From c84597ecd09672878fe7c6a70dca5af24f158829 Mon Sep 17 00:00:00 2001 From: Ishaan Jaffer Date: Tue, 14 Apr 2026 18:20:34 -0700 Subject: [PATCH] fix(bedrock/converse): capture raw input_tokens as text_tokens before cache inflation in PromptTokensDetailsWrapper --- litellm/llms/bedrock/chat/converse_transformation.py | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/litellm/llms/bedrock/chat/converse_transformation.py b/litellm/llms/bedrock/chat/converse_transformation.py index 5cfb00d69b6..4e71c9584ab 100644 --- a/litellm/llms/bedrock/chat/converse_transformation.py +++ b/litellm/llms/bedrock/chat/converse_transformation.py @@ -1651,6 +1651,7 @@ class AmazonConverseConfig(BaseConfig): cache_creation_input_tokens: int = 0 cache_read_input_tokens: int = 0 + raw_input_tokens = input_tokens # capture before inflation if "cacheReadInputTokens" in usage: cache_read_input_tokens = usage["cacheReadInputTokens"] input_tokens += cache_read_input_tokens @@ -1659,7 +1660,9 @@ class AmazonConverseConfig(BaseConfig): input_tokens += cache_creation_input_tokens prompt_tokens_details = PromptTokensDetailsWrapper( - cached_tokens=cache_read_input_tokens + cached_tokens=cache_read_input_tokens, + cache_creation_tokens=cache_creation_input_tokens, + text_tokens=raw_input_tokens, ) reasoning_tokens = ( token_counter(text=reasoning_content, count_response_tokens=True)