From 72b334e1391864a67f5007656be8b45a9bd9b7de Mon Sep 17 00:00:00 2001 From: junq <22017000+QiJune@users.noreply.github.com> Date: Thu, 14 Aug 2025 14:59:33 +0800 Subject: [PATCH] improve error message Signed-off-by: junq <22017000+QiJune@users.noreply.github.com> --- tensorrt_llm/_torch/attention_backend/trtllm.py | 8 +++++++- 1 file changed, 7 insertions(+), 1 deletion(-) diff --git a/tensorrt_llm/_torch/attention_backend/trtllm.py b/tensorrt_llm/_torch/attention_backend/trtllm.py index a8335150207e..b6c3a68930d1 100644 --- a/tensorrt_llm/_torch/attention_backend/trtllm.py +++ b/tensorrt_llm/_torch/attention_backend/trtllm.py @@ -763,8 +763,14 @@ def prepare(self) -> None: self.kv_cache_block_offsets[:, :self.num_seqs].copy_( self.host_kv_cache_block_offsets[:, :self.num_seqs], non_blocking=True) + + error_message = ( + f"The max KV cache length of input sequences ({self.kv_lens[:self.num_seqs].max()}) " + f"exceeds the KV cache manager's maximum supported length " + f"({self.kv_cache_manager.max_seq_len}).") + assert self.kv_lens[:self.num_seqs].max( - ) <= self.kv_cache_manager.max_seq_len, f"Please set max_seq_len to at least {self.kv_lens[:self.num_seqs].max()} for kv cache manager." + ) <= self.kv_cache_manager.max_seq_len, error_message self.kv_lens_cuda_runtime = self.kv_lens_cuda[:self.num_seqs] self.kv_lens_runtime = self.kv_lens[:self.num_seqs]