Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
Expand Up @@ -1568,15 +1568,17 @@ def test_auto_dtype(self, block_reuse, mocker):
ctx_server_config = {
"disable_overlap_scheduler": True,
"cache_transceiver_config": {
"backend": "DEFAULT",
"backend": "NIXL",
"transceiver_runtime": "PYTHON",
"max_tokens_in_buffer": 4096
},
"tensor_parallel_size": 4
}
gen_server_config = {
"disable_overlap_scheduler": False,
"cache_transceiver_config": {
"backend": "DEFAULT",
"backend": "NIXL",
"transceiver_runtime": "PYTHON",
"max_tokens_in_buffer": 4096
},
"tensor_parallel_size": 4
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -26,7 +26,8 @@ context_servers:
cuda_graph_config: null
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
generation_servers:
num_instances: 1
Expand Down Expand Up @@ -63,5 +64,6 @@ generation_servers:
- 1024
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
Original file line number Diff line number Diff line change
Expand Up @@ -26,7 +26,8 @@ context_servers:
cuda_graph_config: null
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
generation_servers:
num_instances: 1
Expand Down Expand Up @@ -63,5 +64,6 @@ generation_servers:
- 1024
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
Original file line number Diff line number Diff line change
Expand Up @@ -22,7 +22,8 @@ context_servers:
cuda_graph_config: null
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
generation_servers:
num_instances: 1
Expand Down Expand Up @@ -59,5 +60,6 @@ generation_servers:
- 1024
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
Original file line number Diff line number Diff line change
Expand Up @@ -21,7 +21,8 @@ context_servers:
cuda_graph_config: null
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
generation_servers:
num_instances: 1
Expand Down Expand Up @@ -53,5 +54,6 @@ generation_servers:
- 128
print_iter_log: true
cache_transceiver_config:
backend: DEFAULT
backend: NIXL
transceiver_runtime: PYTHON
max_tokens_in_buffer: 16384
Original file line number Diff line number Diff line change
Expand Up @@ -57,6 +57,7 @@ worker_config:
enable_padding: true
max_batch_size: 1536
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -65,6 +66,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -79,6 +81,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -88,4 +91,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -57,6 +57,7 @@ worker_config:
enable_padding: true
max_batch_size: 1536
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -65,6 +66,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -79,6 +81,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -88,4 +91,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -53,6 +53,7 @@ worker_config:
enable_padding: true
max_batch_size: 256
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -61,6 +62,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -75,6 +77,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -84,4 +87,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -65,6 +65,7 @@ worker_config:
enable_padding: true
max_batch_size: 1280
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.85
dtype: fp8
Expand All @@ -73,6 +74,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 9216
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: false
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -91,6 +93,7 @@ worker_config:
enable_padding: true
max_batch_size: 30
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.8
dtype: fp8
Expand All @@ -99,6 +102,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 9216
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Original file line number Diff line number Diff line change
Expand Up @@ -53,6 +53,7 @@ worker_config:
enable_padding: true
max_batch_size: 1024
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -61,6 +62,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -75,6 +77,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -84,4 +87,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -53,6 +53,7 @@ worker_config:
enable_padding: true
max_batch_size: 1024
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -61,6 +62,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -75,6 +77,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -84,4 +87,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -57,6 +57,7 @@ worker_config:
enable_padding: true
max_batch_size: 512
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -65,6 +66,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -79,6 +81,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -88,4 +91,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 8448
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -68,6 +68,7 @@ worker_config:
enable_padding: true
max_batch_size: 1536
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -76,6 +77,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -90,6 +92,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -99,4 +102,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -68,6 +68,7 @@ worker_config:
enable_padding: true
max_batch_size: 1536
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -76,6 +77,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -90,6 +92,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -99,4 +102,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Original file line number Diff line number Diff line change
Expand Up @@ -64,6 +64,7 @@ worker_config:
enable_padding: true
max_batch_size: 256
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -72,6 +73,7 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
num_postprocess_workers: 4
stream_interval: 20
Expand All @@ -86,6 +88,7 @@ worker_config:
enable_attention_dp: false
cuda_graph_config: null
kv_cache_config:
use_kv_cache_manager_v2: false
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
dtype: fp8
Expand All @@ -95,4 +98,5 @@ worker_config:
cache_transceiver_config:
max_tokens_in_buffer: 1024
backend: NIXL
transceiver_runtime: PYTHON
disable_overlap_scheduler: true
Loading
Loading