diff --git a/tests/integration/defs/.test_durations b/tests/integration/defs/.test_durations index 3124009b462d..9a7cdb70178b 100644 --- a/tests/integration/defs/.test_durations +++ b/tests/integration/defs/.test_durations @@ -352,7 +352,6 @@ "disaggregated/test_disaggregated.py::test_disaggregated_overlap[TinyLlama-1.1B-Chat-v1.0]": 98.97588296607137, "disaggregated/test_disaggregated.py::test_disaggregated_single_gpu[TinyLlama-1.1B-Chat-v1.0]": 67.9668476767838, "disaggregated/test_disaggregated.py::test_disaggregated_single_gpu_trt_backend[TinyLlama-1.1B-Chat-v1.0]": 82.28277984517626, - "disaggregated/test_disaggregated.py::test_disaggregated_trtllm_sampler[TinyLlama-1.1B-Chat-v1.0]": 62.51559329708107, "disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_llama_context_capacity[False-False-DeepSeek-V3-Lite-fp8/fp8]": 238.76137515995651, "disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_simple_deepseek[False-False-DeepSeek-V3-Lite-fp8/fp8]": 78.98068026197143, "disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_simple_deepseek[False-True-DeepSeek-V3-Lite-fp8/fp8]": 77.51831256924197, diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_trtllm_sampler.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_trtllm_sampler.yaml deleted file mode 100644 index f972a655c860..000000000000 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_trtllm_sampler.yaml +++ /dev/null @@ -1,33 +0,0 @@ -model: TinyLlama/TinyLlama-1.1B-Chat-v1.0 -hostname: localhost -backend: pytorch -cuda_graph_config: null -free_gpu_memory_fraction: 0.2 -context_servers: - num_instances: 1 - max_batch_size: 1 - max_num_tokens: 3000 - max_seq_len: 4096 - tensor_parallel_size: 1 - pipeline_parallel_size: 1 - sampler_type: TRTLLMSampler - kv_cache_config: - free_gpu_memory_fraction: 0.2 - enable_partial_reuse: false - cache_transceiver_config: - backend: DEFAULT - disable_overlap_scheduler: true -generation_servers: - num_instances: 1 - tensor_parallel_size: 1 - pipeline_parallel_size: 1 - max_batch_size: 256 - max_num_tokens: 4096 - max_seq_len: 4096 - sampler_type: TRTLLMSampler - kv_cache_config: - free_gpu_memory_fraction: 0.2 - enable_partial_reuse: false - cache_transceiver_config: - backend: DEFAULT - disable_overlap_scheduler: false diff --git a/tests/integration/defs/disaggregated/test_disaggregated.py b/tests/integration/defs/disaggregated/test_disaggregated.py index 1ced8bf7fc06..d57a6faeed09 100644 --- a/tests/integration/defs/disaggregated/test_disaggregated.py +++ b/tests/integration/defs/disaggregated/test_disaggregated.py @@ -189,8 +189,6 @@ def get_test_config(test_desc, example_dir, test_root): f"{test_configs_root}/disagg_config_overlap.yaml", "perf_metrics": f"{test_configs_root}/disagg_config_metrics.yaml", - "trtllm_sampler": - f"{test_configs_root}/disagg_config_trtllm_sampler.yaml", "load_balance": f"{test_configs_root}/disagg_config_load_balance.yaml", "cache_aware_balance": @@ -321,7 +319,7 @@ def get_client_test_set(test_desc): verify_streaming_completion=True, verify_chat=False, verify_streaming_chat=False) - if test_desc.startswith("overlap") or test_desc == "trtllm_sampler": + if test_desc.startswith("overlap"): return ClientTestSet(completion=True, completion_streaming=True, chat=True, @@ -1054,21 +1052,6 @@ def test_disaggregated_kv_cache_time_output(disaggregated_test_root, llm_venv, assert matched -@pytest.mark.parametrize("llama_model_root", ['TinyLlama-1.1B-Chat-v1.0'], - indirect=True) -def test_disaggregated_trtllm_sampler(disaggregated_test_root, llm_venv, - disaggregated_example_root, - llama_model_root): - setup_model_symlink(llm_venv, llama_model_root, - "TinyLlama/TinyLlama-1.1B-Chat-v1.0") - - run_disaggregated_test(disaggregated_example_root, - "trtllm_sampler", - env=llm_venv._new_env, - model_path=llama_model_root, - cwd=llm_venv.get_working_directory()) - - @pytest.mark.parametrize("llama_model_root", ['TinyLlama-1.1B-Chat-v1.0'], indirect=True) def test_disaggregated_load_balance(disaggregated_test_root, llm_venv, diff --git a/tests/integration/test_lists/qa/llm_function_core.txt b/tests/integration/test_lists/qa/llm_function_core.txt index 4653b6ac31c1..72e9bcfa6036 100644 --- a/tests/integration/test_lists/qa/llm_function_core.txt +++ b/tests/integration/test_lists/qa/llm_function_core.txt @@ -868,7 +868,6 @@ disaggregated/test_disaggregated.py::test_disaggregated_overlap_transceiver_runt disaggregated/test_disaggregated.py::test_disaggregated_perf_metrics[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_single_gpu[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_single_gpu_trt_backend[TinyLlama-1.1B-Chat-v1.0] -disaggregated/test_disaggregated.py::test_disaggregated_trtllm_sampler[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_cancel_gen_requests[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_llama_context_capacity[False-False-DeepSeek-V3-Lite-fp8/fp8] disaggregated/test_disaggregated_single_gpu.py::test_disaggregated_logits[False-TinyLlama-1.1B-Chat-v1.0] diff --git a/tests/integration/test_lists/qa/llm_function_rtx6k.txt b/tests/integration/test_lists/qa/llm_function_rtx6k.txt index 54c04f131119..a5b1c45d5c39 100644 --- a/tests/integration/test_lists/qa/llm_function_rtx6k.txt +++ b/tests/integration/test_lists/qa/llm_function_rtx6k.txt @@ -238,7 +238,6 @@ disaggregated/test_disaggregated.py::test_disaggregated_multi_gpu[TinyLlama-1.1B disaggregated/test_disaggregated.py::test_disaggregated_cuda_graph[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_load_balance[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_cache_aware_balance[TinyLlama-1.1B-Chat-v1.0] -disaggregated/test_disaggregated.py::test_disaggregated_trtllm_sampler[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_ctxtp2pp2_gentp2pp2[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_ctxpp4_genpp4[TinyLlama-1.1B-Chat-v1.0] disaggregated/test_disaggregated.py::test_disaggregated_kv_cache_time_output[TinyLlama-1.1B-Chat-v1.0] diff --git a/tests/integration/test_lists/waives.txt b/tests/integration/test_lists/waives.txt index 9ccb9b6b52c8..22815b3ad926 100644 --- a/tests/integration/test_lists/waives.txt +++ b/tests/integration/test_lists/waives.txt @@ -246,7 +246,6 @@ disaggregated/test_disaggregated.py::test_disaggregated_multi_gpu_trt_backend[Ti disaggregated/test_disaggregated.py::test_disaggregated_perf_metrics[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6094100) disaggregated/test_disaggregated.py::test_disaggregated_single_gpu[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6184906) disaggregated/test_disaggregated.py::test_disaggregated_single_gpu_trt_backend[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6094100) -disaggregated/test_disaggregated.py::test_disaggregated_trtllm_sampler[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6114141) disaggregated/test_workers.py::test_workers_conditional_disaggregation_deepseek_v3_lite_bf16[DeepSeek-V3-Lite-bf16] SKIP (https://nvbugs/6094100) disaggregated/test_workers.py::test_workers_conversation_router[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6162322) disaggregated/test_workers.py::test_workers_kv_cache_aware_router[TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6094100)