Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
Show all changes
21 commits
Select commit Hold shift + click to select a range
d6badd3
[None][test] unify yaml validation harness for curated and database c…
venkywonka Feb 19, 2026
ac98aac
[None][chore] Removing print_iter_log from curated configs.
fsaady Feb 19, 2026
a15ea4f
[None][test] extend curated config unit tests.
fsaady Feb 20, 2026
f1e5647
Merge remote-tracking branch 'origin/main' into fsaady/fix-curated-co…
fsaady Feb 20, 2026
7ca2544
[None][test] removing load_format hack from yaml_validation_harness.
fsaady Feb 20, 2026
fca59e4
[None][test] Moving config database tests into one place.
fsaady Feb 23, 2026
ff9c2df
Merge branch 'main' into fsaady/fix-curated-configs
fsaady Feb 24, 2026
5a6d7d6
[None][test] Removing assert_custom_policy, calling policy directly.
fsaady Feb 24, 2026
fae9ea3
[None][fix] Handling model-specific default args in test_config_datab…
fsaady Feb 24, 2026
ca44e7e
Merge remote-tracking branch 'origin/fsaady/fix-curated-configs' into…
fsaady Feb 24, 2026
2ba3870
[None][chore] Check that all configs have a lookup entry in test_conf…
fsaady Feb 24, 2026
2039bbf
Merge branch 'main' into fsaady/fix-curated-configs
fsaady Feb 24, 2026
8b4fd78
Merge remote-tracking branch 'origin/main' into fsaady/fix-curated-co…
fsaady Feb 25, 2026
3a68691
[None][chore] Adding model arch to examples/configs/database/lookup.y…
fsaady Feb 25, 2026
861caab
[None][test] Forcing entries in db lookup.yaml to specify architecture.
fsaady Feb 25, 2026
058739a
Merge branch 'main' into fsaady/fix-curated-configs
fsaady Feb 25, 2026
28ec9dd
[None][chore] removing unneeded mock in test_config_database.
fsaady Feb 25, 2026
b6806ac
Merge remote-tracking branch 'origin/fsaady/fix-curated-configs' into…
fsaady Feb 25, 2026
58aeb59
[None][chore] minor fix.
fsaady Feb 25, 2026
e2460b5
Merge branch 'main' into fsaady/fix-curated-configs
fsaady Feb 25, 2026
e8315e3
Merge branch 'main' into fsaady/fix-curated-configs
fsaady Feb 26, 2026
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 0 additions & 1 deletion examples/configs/curated/deepseek-r1-deepgemm.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -6,7 +6,6 @@ trust_remote_code: true
enable_attention_dp: true
cuda_graph_config:
enable_padding: true
max_batch_size: 128
kv_cache_config:
dtype: fp8
free_gpu_memory_fraction: 0.8
Expand Down
4 changes: 2 additions & 2 deletions examples/configs/curated/deepseek-r1-latency.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -3,10 +3,10 @@ tensor_parallel_size: 8
moe_expert_parallel_size: 2
max_num_tokens: 32768
trust_remote_code: true
moe_backend: TRTLLM
use_cuda_graph: true
kv_cache_config:
free_gpu_memory_fraction: 0.75
moe_config:
backend: TRTLLM
speculative_config:
decoding_type: MTP
num_nextn_predict_layers: 3
Expand Down
1 change: 0 additions & 1 deletion examples/configs/curated/deepseek-r1-throughput.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -6,7 +6,6 @@ trust_remote_code: true
enable_attention_dp: true
cuda_graph_config:
enable_padding: true
max_batch_size: 128
kv_cache_config:
dtype: fp8
free_gpu_memory_fraction: 0.8
Expand Down
3 changes: 0 additions & 3 deletions examples/configs/curated/gpt-oss-120b-latency.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -3,9 +3,6 @@ max_num_tokens: 16384
tensor_parallel_size: 8
moe_expert_parallel_size: 1
trust_remote_code: true
enable_attention_dp: false
kv_cache_config:
free_gpu_memory_fraction: 0.9
cuda_graph_config:
enable_padding: true
max_batch_size: 64
Expand Down
2 changes: 0 additions & 2 deletions examples/configs/curated/gpt-oss-120b-throughput.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -4,8 +4,6 @@ tensor_parallel_size: 2
moe_expert_parallel_size: 2
trust_remote_code: true
enable_attention_dp: true
kv_cache_config:
free_gpu_memory_fraction: 0.9
cuda_graph_config:
enable_padding: true
max_batch_size: 720
Expand Down
1 change: 0 additions & 1 deletion examples/configs/curated/kimi-k2-thinking.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -4,7 +4,6 @@ max_seq_len: 8212
tensor_parallel_size: 8
moe_expert_parallel_size: 8
enable_attention_dp: true
pipeline_parallel_size: 1
print_iter_log: true
kv_cache_config:
free_gpu_memory_fraction: 0.75
Expand Down
3 changes: 0 additions & 3 deletions examples/configs/curated/llama-3.3-70b.yaml
Original file line number Diff line number Diff line change
@@ -1,12 +1,9 @@
max_batch_size: 1024
max_num_tokens: 2048
tensor_parallel_size: 1
moe_expert_parallel_size: 1
trust_remote_code: true
enable_attention_dp: false
cuda_graph_config:
enable_padding: true
max_batch_size: 1024
kv_cache_config:
dtype: fp8
free_gpu_memory_fraction: 0.9
3 changes: 0 additions & 3 deletions examples/configs/curated/llama-4-scout.yaml
Original file line number Diff line number Diff line change
@@ -1,12 +1,9 @@
max_batch_size: 1024
max_num_tokens: 2048
tensor_parallel_size: 1
moe_expert_parallel_size: 1
trust_remote_code: true
enable_attention_dp: false
cuda_graph_config:
enable_padding: true
max_batch_size: 1024
kv_cache_config:
dtype: fp8
free_gpu_memory_fraction: 0.9
34 changes: 34 additions & 0 deletions examples/configs/curated/lookup.yaml
Original file line number Diff line number Diff line change
@@ -0,0 +1,34 @@
# arch: MODEL_CLASS_MAPPING key; required when model has get_model_defaults. Add when adding entries.
- model: Qwen/Qwen3-Next-80B-A3B-Thinking
arch: Qwen3NextForCausalLM
config_path: examples/configs/curated/qwen3-next.yaml
- model: Qwen/Qwen3-30B-A3B
arch: Qwen3MoeForCausalLM
config_path: examples/configs/curated/qwen3.yaml
- model: Qwen/Qwen3-30B-A3B
arch: Qwen3MoeForCausalLM
config_path: examples/configs/curated/qwen3-disagg-prefill.yaml
- model: deepseek-ai/DeepSeek-R1-0528
arch: DeepseekV3ForCausalLM
config_path: examples/configs/curated/deepseek-r1-latency.yaml
- model: deepseek-ai/DeepSeek-R1-0528
arch: DeepseekV3ForCausalLM
config_path: examples/configs/curated/deepseek-r1-throughput.yaml
- model: deepseek-ai/DeepSeek-R1-0528
arch: DeepseekV3ForCausalLM
config_path: examples/configs/curated/deepseek-r1-deepgemm.yaml
- model: openai/gpt-oss-120b
arch: GptOssForCausalLM
config_path: examples/configs/curated/gpt-oss-120b-latency.yaml
- model: openai/gpt-oss-120b
arch: GptOssForCausalLM
config_path: examples/configs/curated/gpt-oss-120b-throughput.yaml
- model: nvidia/Llama-3.3-70B-Instruct-FP8
arch: LlamaForCausalLM
config_path: examples/configs/curated/llama-3.3-70b.yaml
- model: nvidia/Llama-4-Scout-17B-16E-Instruct-FP8
arch: Llama4ForConditionalGeneration
config_path: examples/configs/curated/llama-4-scout.yaml
- model: nvidia/Kimi-K2-Thinking-NVFP4
arch: DeepseekV3ForCausalLM
config_path: examples/configs/curated/kimi-k2-thinking.yaml
6 changes: 2 additions & 4 deletions examples/configs/curated/qwen3-disagg-prefill.yaml
Original file line number Diff line number Diff line change
@@ -1,9 +1,7 @@
max_batch_size: 161
max_num_tokens: 1160
kv_cache_config:
free_gpu_memory_fraction: 0.8
tensor_parallel_size: 1
moe_expert_parallel_size: 1
trust_remote_code: true
print_iter_log: true
enable_attention_dp: true
kv_cache_config:
free_gpu_memory_fraction: 0.8
6 changes: 1 addition & 5 deletions examples/configs/curated/qwen3-next.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -3,14 +3,10 @@ max_num_tokens: 4096
tensor_parallel_size: 4
moe_expert_parallel_size: 4
trust_remote_code: true
enable_attention_dp: false
cuda_graph_config:
enable_padding: true
max_batch_size: 720
moe_config:
backend: TRTLLM
backend: TRTLLM
stream_interval: 20
num_postprocess_workers: 4
kv_cache_config:
enable_block_reuse: false
free_gpu_memory_fraction: 0.9
6 changes: 2 additions & 4 deletions examples/configs/curated/qwen3.yaml
Original file line number Diff line number Diff line change
@@ -1,8 +1,5 @@
max_batch_size: 161
max_num_tokens: 1160
kv_cache_config:
free_gpu_memory_fraction: 0.8
tensor_parallel_size: 1
moe_expert_parallel_size: 1
cuda_graph_config:
enable_padding: true
Expand All @@ -17,5 +14,6 @@ cuda_graph_config:
- 128
- 256
- 384
print_iter_log: true
enable_attention_dp: true
kv_cache_config:
free_gpu_memory_fraction: 0.8
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Original file line number Diff line number Diff line change
Expand Up @@ -16,6 +16,5 @@ attention_dp_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Original file line number Diff line number Diff line change
@@ -1,7 +1,6 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 256
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +11,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 1152
max_seq_len: 2068
Original file line number Diff line number Diff line change
@@ -1,7 +1,5 @@
cuda_graph_config:
enable_padding: true
max_batch_size: 128
enable_attention_dp: false
print_iter_log: true
kv_cache_config:
dtype: fp8
Expand All @@ -12,6 +10,5 @@ moe_config:
tensor_parallel_size: 8
moe_expert_parallel_size: 8
trust_remote_code: true
backend: pytorch
max_num_tokens: 8320
max_seq_len: 9416
Loading