From ad602ed08b77963cb4e92218ad586b27b521eeea Mon Sep 17 00:00:00 2001 From: ixlmar <206748156+ixlmar@users.noreply.github.com> Date: Mon, 22 Sep 2025 18:05:56 +0200 Subject: [PATCH] test: do not explicitly pass temperature=0 to select greedy sampling Signed-off-by: ixlmar <206748156+ixlmar@users.noreply.github.com> --- tensorrt_llm/evaluate/json_mode_eval.py | 3 +-- tensorrt_llm/evaluate/mmlu.py | 2 +- tests/unittest/llmapi/apps/_test_openai_misc.py | 3 --- 3 files changed, 2 insertions(+), 6 deletions(-) diff --git a/tensorrt_llm/evaluate/json_mode_eval.py b/tensorrt_llm/evaluate/json_mode_eval.py index 122cbd6e7e41..37360754e503 100644 --- a/tensorrt_llm/evaluate/json_mode_eval.py +++ b/tensorrt_llm/evaluate/json_mode_eval.py @@ -64,8 +64,7 @@ def generate_samples(self) -> Iterable[tuple]: schema["x-guidance"] = {"lenient": True} schema = json.dumps(schema) sampling_args = { - "guided_decoding": GuidedDecodingParams(json=schema), - "temperature": 0, + "guided_decoding": GuidedDecodingParams(json=schema) } yield sample["prompt"], sampling_args, sample["completion"], sample[ "schema"] diff --git a/tensorrt_llm/evaluate/mmlu.py b/tensorrt_llm/evaluate/mmlu.py index b3b3f4ee7cf8..92d7ae1171a3 100644 --- a/tensorrt_llm/evaluate/mmlu.py +++ b/tensorrt_llm/evaluate/mmlu.py @@ -219,7 +219,7 @@ def generate_samples(self) -> Iterable[tuple]: include_answer=False) prompt = train_prompt + prompt_end label = test_df.iloc[i, test_df.shape[1] - 1] - yield prompt, {"temperature": 0}, label, subject + yield prompt, None, label, subject def compute_score(self, outputs: List[RequestOutput], references: List[str], subjects: List[str]) -> float: diff --git a/tests/unittest/llmapi/apps/_test_openai_misc.py b/tests/unittest/llmapi/apps/_test_openai_misc.py index 7dcac12304a4..8cc715389f31 100644 --- a/tests/unittest/llmapi/apps/_test_openai_misc.py +++ b/tests/unittest/llmapi/apps/_test_openai_misc.py @@ -94,12 +94,9 @@ async def test_request_cancellation(server: RemoteOpenAIServer, # Request about 2 million tokens for _ in range(200): task = asyncio.create_task( - # FIXME: Some requests complete quickly without temperature=0, - # despite min_tokens being specified, cf. https://nvbugs/5513423 client.chat.completions.create(messages=chat_input, model=model_name, max_tokens=10000, - temperature=0, extra_body={"min_tokens": 10000})) tasks.append(task)