diff --git a/tensorrt_llm/_torch/attention_backend/flashinfer.py b/tensorrt_llm/_torch/attention_backend/flashinfer.py index 49964319a18a..3322422075dc 100644 --- a/tensorrt_llm/_torch/attention_backend/flashinfer.py +++ b/tensorrt_llm/_torch/attention_backend/flashinfer.py @@ -1006,7 +1006,6 @@ def _plan_with_params(self, self.kv_layout, backend="cudnn", )) - torch.cuda.current_stream().synchronize() if self.num_contexts <= 0: raise ValueError( "FlashInfer ragged prefill without KV cache requires "