[None][test] CI-only: RUN (not skip) gb200 deepseek-v32 gen-only perf-sanity at 33b0a32 (DO NOT MERGE) - #15224
Conversation
33b0a32 Empty commit on top of 33b0a32 (tree unchanged) to open a PR that runs: perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only- gb200_deepseek-v32-fp4_1k1k_con2048_ctx1_dep4_gen1_dep4_eplb0_mtp1_ccb-NIXL] 33b0a32 is a known-good commit for this case (it passed in post-merge history). This PR re-runs the same case in pre-merge CI to check whether the gen-server CUDA-graph capture crash (cudaErrorLaunchFailure) reproduces on known-good code, which would indicate the failure is environmental (machine status / node env) rather than related to TRT-LLM code. Do not merge. Signed-off-by: Chenfei Zhang <chenfeiz@nvidia.com>
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #53328 [ ] completed with state |
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #53442 [ run ] triggered by Bot. Commit: |
|
PR_Github #53442 [ run ] completed with state |
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #53986 [ run ] triggered by Bot. Commit: |
|
PR_Github #53986 [ run ] completed with state |
…en-only perf-sanity No-op comment in test_perf_sanity.py so the pre-merge stage GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4 re-runs instead of being skipped as already-passed. Signed-off-by: Chenfei Zhang <chenfeiz@nvidia.com>
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
1 similar comment
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #54035 [ run ] triggered by Bot. Commit: |
|
PR_Github #54035 [ run ] completed with state |
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
1 similar comment
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #54042 [ run ] triggered by Bot. Commit: |
|
PR_Github #54042 [ run ] completed with state
|
…v32 gen-only perf-sanity Bumps the no-op marker in test_perf_sanity.py so the pre-merge stage GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4 re-runs instead of being skipped as already-passed. Signed-off-by: Chenfei Zhang <chenfeiz@nvidia.com>
|
/bot run --disable-fail-fast --stage-list "GB200-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #54131 [ run ] triggered by Bot. Commit: |
|
PR_Github #54131 [ run ] completed with state
|
|
/bot run --disable-fail-fast --stage-list "GB300-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-4" |
|
PR_Github #54231 [ run ] triggered by Bot. Commit: |
|
PR_Github #54231 [ run ] completed with state |
|
/bot run --disable-fail-fast --stage-list "GB300-8_GPUs-2_Nodes-PyTorch-Disagg-PerfSanity-CTX1-NODE1-GPU4-GEN1-NODE1-GPU4-Post-Merge-2" |
|
PR_Github #54307 [ run ] triggered by Bot. Commit: |
|
PR_Github #54307 [ run ] completed with state
|
CI-only PR — DO NOT MERGE.
Purpose: actually run (not skip) the case
perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-v32-fp4_1k1k_con2048_ctx1_dep4_gen1_dep4_eplb0_mtp1_ccb-NIXL]against commit
33b0a32(DeepGemmFusedMoE Triton fuse, #14592).Why the base was changed from
main:Pre-merge CI tests the merge result, which inherits the base branch's
waives.txt.main'swaives.txtwaives this exact case (line ~295, nvbugs/6280649), so a PR based onmainskips it and reports a false "success."Fix: base is now
chenfeiz/test-v32-gen-33b0a32-base, a branch pinned at exactly33b0a32that does not waive this case. The head branch is
33b0a32+ a trivial no-op edit, so:33b0a32waives.txtdoes not skip the case → the case actually runs.