diff --git a/tests/integration/defs/accuracy/test_disaggregated_serving.py b/tests/integration/defs/accuracy/test_disaggregated_serving.py index 87cf50f0d552..5efe77541914 100644 --- a/tests/integration/defs/accuracy/test_disaggregated_serving.py +++ b/tests/integration/defs/accuracy/test_disaggregated_serving.py @@ -1568,7 +1568,8 @@ def test_auto_dtype(self, block_reuse, mocker): ctx_server_config = { "disable_overlap_scheduler": True, "cache_transceiver_config": { - "backend": "DEFAULT", + "backend": "NIXL", + "transceiver_runtime": "PYTHON", "max_tokens_in_buffer": 4096 }, "tensor_parallel_size": 4 @@ -1576,7 +1577,8 @@ def test_auto_dtype(self, block_reuse, mocker): gen_server_config = { "disable_overlap_scheduler": False, "cache_transceiver_config": { - "backend": "DEFAULT", + "backend": "NIXL", + "transceiver_runtime": "PYTHON", "max_tokens_in_buffer": 4096 }, "tensor_parallel_size": 4 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_triton.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_triton.yaml index b7e04b714d00..ac6f24da0c29 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_triton.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_triton.yaml @@ -26,7 +26,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -63,5 +64,6 @@ generation_servers: - 1024 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_trtllm.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_trtllm.yaml index 1ebbe92ac159..b52cc95463de 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_trtllm.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_eagle_trtllm.yaml @@ -26,7 +26,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -63,5 +64,6 @@ generation_servers: - 1024 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_tllm.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_tllm.yaml index 7bfe604313cd..62e3a876529f 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_tllm.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_tllm.yaml @@ -22,7 +22,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -59,5 +60,6 @@ generation_servers: - 1024 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_triton.yaml b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_triton.yaml index 1d6f4d336e01..e120f830c335 100644 --- a/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_triton.yaml +++ b/tests/integration/defs/disaggregated/test_configs/disagg_config_ctxtp2_gentp2_gptoss_triton.yaml @@ -21,7 +21,8 @@ context_servers: cuda_graph_config: null print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 generation_servers: num_instances: 1 @@ -53,5 +54,6 @@ generation_servers: - 128 print_iter_log: true cache_transceiver_config: - backend: DEFAULT + backend: NIXL + transceiver_runtime: PYTHON max_tokens_in_buffer: 16384 diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index 2190a3cce964..31d9830a3cbf 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -57,6 +57,7 @@ worker_config: enable_padding: true max_batch_size: 1536 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -65,6 +66,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -79,6 +81,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -88,4 +91,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index 0d19f8e4e27e..ab2d60d153b6 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -57,6 +57,7 @@ worker_config: enable_padding: true max_batch_size: 1536 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -65,6 +66,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -79,6 +81,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -88,4 +91,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 88c2fb4472ee..9c82b55a4a17 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -53,6 +53,7 @@ worker_config: enable_padding: true max_batch_size: 256 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -61,6 +62,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -75,6 +77,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -84,4 +87,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 2f3d0e8a64ef..9f4b7086060d 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -65,6 +65,7 @@ worker_config: enable_padding: true max_batch_size: 1280 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.85 dtype: fp8 @@ -73,6 +74,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 9216 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: false num_postprocess_workers: 4 stream_interval: 20 @@ -91,6 +93,7 @@ worker_config: enable_padding: true max_batch_size: 30 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.8 dtype: fp8 @@ -99,6 +102,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 9216 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 4cfefd539365..c9f73573fcf9 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -53,6 +53,7 @@ worker_config: enable_padding: true max_batch_size: 1024 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -61,6 +62,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -75,6 +77,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -84,4 +87,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 51365542c142..9610d4a5bdf9 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -53,6 +53,7 @@ worker_config: enable_padding: true max_batch_size: 1024 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -61,6 +62,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -75,6 +77,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -84,4 +87,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index f1a77c15f944..4f392589d564 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -57,6 +57,7 @@ worker_config: enable_padding: true max_batch_size: 512 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -65,6 +66,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -79,6 +81,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -88,4 +91,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index 8eef9c444195..20a89f47b3c7 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con2048_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -68,6 +68,7 @@ worker_config: enable_padding: true max_batch_size: 1536 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -76,6 +77,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -90,6 +92,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -99,4 +102,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index ff52e6819ca1..d1e80f7a9229 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -68,6 +68,7 @@ worker_config: enable_padding: true max_batch_size: 1536 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -76,6 +77,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -90,6 +92,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -99,4 +102,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 8618b346f7ea..020e476bf118 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_1k1k_con64_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -64,6 +64,7 @@ worker_config: enable_padding: true max_batch_size: 256 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -72,6 +73,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -86,6 +88,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -95,4 +98,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 1024 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 2f3d0e8a64ef..9f4b7086060d 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -65,6 +65,7 @@ worker_config: enable_padding: true max_batch_size: 1280 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.85 dtype: fp8 @@ -73,6 +74,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 9216 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: false num_postprocess_workers: 4 stream_interval: 20 @@ -91,6 +93,7 @@ worker_config: enable_padding: true max_batch_size: 30 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.8 dtype: fp8 @@ -99,6 +102,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 9216 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index 38b46c465050..9ed015cd6cda 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -64,6 +64,7 @@ worker_config: enable_padding: true max_batch_size: 1024 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -72,6 +73,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -86,6 +88,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -95,4 +98,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml index f663223f9b46..5476fae34c0e 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL.yaml @@ -64,6 +64,7 @@ worker_config: enable_padding: true max_batch_size: 1024 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -72,6 +73,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -86,6 +88,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -95,4 +98,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml index 56521e5293c9..598fd70d2983 100644 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL.yaml @@ -68,6 +68,7 @@ worker_config: enable_padding: true max_batch_size: 512 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -76,6 +77,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true num_postprocess_workers: 4 stream_interval: 20 @@ -90,6 +92,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -99,4 +102,5 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_stress-gpt-oss-120b-fp4_8k1k_ctx1_tp1_gen1_tp4_eplb0_eagle3_ccb-NIXL.yaml b/tests/scripts/perf/disaggregated/gb200_stress-gpt-oss-120b-fp4_8k1k_ctx1_tp1_gen1_tp4_eplb0_eagle3_ccb-NIXL.yaml index 00266300a083..0701596a0bad 100644 --- a/tests/scripts/perf/disaggregated/gb200_stress-gpt-oss-120b-fp4_8k1k_ctx1_tp1_gen1_tp4_eplb0_eagle3_ccb-NIXL.yaml +++ b/tests/scripts/perf/disaggregated/gb200_stress-gpt-oss-120b-fp4_8k1k_ctx1_tp1_gen1_tp4_eplb0_eagle3_ccb-NIXL.yaml @@ -70,6 +70,7 @@ worker_config: enable_padding: true max_batch_size: 1024 kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -78,6 +79,7 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true speculative_config: &id001 decoding_type: Eagle @@ -97,6 +99,7 @@ worker_config: enable_attention_dp: false cuda_graph_config: null kv_cache_config: + use_kv_cache_manager_v2: false enable_block_reuse: false free_gpu_memory_fraction: 0.9 dtype: fp8 @@ -106,5 +109,6 @@ worker_config: cache_transceiver_config: max_tokens_in_buffer: 8448 backend: NIXL + transceiver_runtime: PYTHON disable_overlap_scheduler: true speculative_config: *id001