diff --git a/litellm/types/utils.py b/litellm/types/utils.py index c246700dc0e..957ce7ea197 100644 --- a/litellm/types/utils.py +++ b/litellm/types/utils.py @@ -276,7 +276,6 @@ class ModelInfoBase(ProviderSpecificModelInfo, total=False): cache_creation_input_token_cost_above_272k_tokens: float | None cache_creation_input_token_cost_above_272k_tokens_priority: float | None cache_creation_input_token_cost_above_272k_tokens_flex: float | None - cache_creation_input_token_cost_above_272k_tokens_balanced: float | None cache_creation_input_token_cost_above_1hr: float | None cache_creation_input_token_cost_flex: float | None # OpenAI flex service tier pricing cache_creation_input_token_cost_balanced: float | None # balanced service tier pricing @@ -294,7 +293,6 @@ class ModelInfoBase(ProviderSpecificModelInfo, total=False): cache_read_input_token_cost_above_272k_tokens: float | None cache_read_input_token_cost_above_272k_tokens_priority: float | None cache_read_input_token_cost_above_272k_tokens_flex: float | None - cache_read_input_token_cost_above_272k_tokens_balanced: float | None cache_read_input_token_cost_above_512k_tokens: float | None cache_read_input_token_cost_batches: ReadOnly[float | None] cache_read_input_token_cost_above_272k_tokens_batches: ReadOnly[float | None] @@ -312,7 +310,6 @@ class ModelInfoBase(ProviderSpecificModelInfo, total=False): input_cost_per_token_above_272k_tokens: float | None # GPT-5.4/5.4-pro: prompts >272K priced at 2x input input_cost_per_token_above_272k_tokens_priority: float | None input_cost_per_token_above_272k_tokens_flex: float | None - input_cost_per_token_above_272k_tokens_balanced: float | None input_cost_per_token_above_512k_tokens: float | None # MiniMax-M3: prompts >512K priced at 2x input input_cost_per_character_above_128k_tokens: float | None # only for vertex ai models input_cost_per_query: float | None # per-request pricing: rerank, search, and Bedrock Marengo embeddings @@ -351,7 +348,6 @@ class ModelInfoBase(ProviderSpecificModelInfo, total=False): output_cost_per_token_above_272k_tokens: float | None # GPT-5.4/5.4-pro: prompts >272K priced at 1.5x output output_cost_per_token_above_272k_tokens_priority: float | None output_cost_per_token_above_272k_tokens_flex: float | None - output_cost_per_token_above_272k_tokens_balanced: float | None output_cost_per_token_above_512k_tokens: float | None # MiniMax-M3: prompts >512K priced at 2x output output_cost_per_character_above_128k_tokens: float | None # only for vertex ai models output_cost_per_image: float | None @@ -3724,7 +3720,6 @@ class CustomPricingLiteLLMParams(MirroredPricingParams): cache_creation_input_token_cost_above_272k_tokens: float | None = None cache_creation_input_token_cost_above_272k_tokens_priority: float | None = None cache_creation_input_token_cost_above_272k_tokens_flex: float | None = None - cache_creation_input_token_cost_above_272k_tokens_balanced: float | None = None cache_creation_input_token_cost_flex: float | None = None cache_creation_input_token_cost_balanced: float | None = None cache_creation_input_token_cost_priority: float | None = None @@ -3738,7 +3733,6 @@ class CustomPricingLiteLLMParams(MirroredPricingParams): cache_read_input_token_cost_above_200k_tokens_priority: float | None = None cache_read_input_token_cost_above_272k_tokens_priority: float | None = None cache_read_input_token_cost_above_272k_tokens_flex: float | None = None - cache_read_input_token_cost_above_272k_tokens_balanced: float | None = None cache_read_input_token_cost_batches: float | None = None cache_read_input_token_cost_above_272k_tokens_batches: float | None = None cache_creation_input_token_cost_batches: float | None = None @@ -3753,7 +3747,6 @@ class CustomPricingLiteLLMParams(MirroredPricingParams): input_cost_per_token_above_200k_tokens_priority: float | None = None input_cost_per_token_above_272k_tokens_priority: float | None = None input_cost_per_token_above_272k_tokens_flex: float | None = None - input_cost_per_token_above_272k_tokens_balanced: float | None = None input_cost_per_token_above_272k_tokens_batches: float | None = None input_cost_per_query: float | None = None input_cost_per_image: float | None = None @@ -3779,7 +3772,6 @@ class CustomPricingLiteLLMParams(MirroredPricingParams): output_cost_per_token_above_200k_tokens_priority: float | None = None output_cost_per_token_above_272k_tokens_priority: float | None = None output_cost_per_token_above_272k_tokens_flex: float | None = None - output_cost_per_token_above_272k_tokens_balanced: float | None = None output_cost_per_token_above_272k_tokens_batches: float | None = None output_cost_per_character_above_128k_tokens: float | None = None output_cost_per_image: float | None = None diff --git a/litellm/utils.py b/litellm/utils.py index 58d2f4b9ef7..b5240c89c4c 100644 --- a/litellm/utils.py +++ b/litellm/utils.py @@ -6075,9 +6075,6 @@ def _get_model_info_helper( cache_creation_input_token_cost_above_272k_tokens_flex=_model_info.get( "cache_creation_input_token_cost_above_272k_tokens_flex", None ), - cache_creation_input_token_cost_above_272k_tokens_balanced=_model_info.get( - "cache_creation_input_token_cost_above_272k_tokens_balanced", None - ), cache_creation_input_token_cost_flex=_model_info.get("cache_creation_input_token_cost_flex", None), cache_creation_input_token_cost_balanced=_model_info.get( "cache_creation_input_token_cost_balanced", None @@ -6106,9 +6103,6 @@ def _get_model_info_helper( cache_read_input_token_cost_above_272k_tokens_flex=_model_info.get( "cache_read_input_token_cost_above_272k_tokens_flex", None ), - cache_read_input_token_cost_above_272k_tokens_balanced=_model_info.get( - "cache_read_input_token_cost_above_272k_tokens_balanced", None - ), cache_read_input_token_cost_above_512k_tokens=_model_info.get( "cache_read_input_token_cost_above_512k_tokens", None ), @@ -6141,9 +6135,6 @@ def _get_model_info_helper( input_cost_per_token_above_272k_tokens_flex=_model_info.get( "input_cost_per_token_above_272k_tokens_flex", None ), - input_cost_per_token_above_272k_tokens_balanced=_model_info.get( - "input_cost_per_token_above_272k_tokens_balanced", None - ), input_cost_per_token_above_512k_tokens=_model_info.get("input_cost_per_token_above_512k_tokens", None), input_cost_per_query=_model_info.get("input_cost_per_query", None), input_cost_per_second=_model_info.get("input_cost_per_second", None), @@ -6207,9 +6198,6 @@ def _get_model_info_helper( output_cost_per_token_above_272k_tokens_flex=_model_info.get( "output_cost_per_token_above_272k_tokens_flex", None ), - output_cost_per_token_above_272k_tokens_balanced=_model_info.get( - "output_cost_per_token_above_272k_tokens_balanced", None - ), output_cost_per_token_above_512k_tokens=_model_info.get( "output_cost_per_token_above_512k_tokens", None ), diff --git a/tests/test_litellm/llms/openai_like/test_sail_provider.py b/tests/test_litellm/llms/openai_like/test_sail_provider.py index 7cafab12262..69b7f9cdf6f 100644 --- a/tests/test_litellm/llms/openai_like/test_sail_provider.py +++ b/tests/test_litellm/llms/openai_like/test_sail_provider.py @@ -517,8 +517,9 @@ class TestSailTierPricing: {"extra_body": {"metadata": {"completion_window": "balanced"}}}, {"extra_body": {"metadata": {"completion_window": "flex"}}}, {"metadata": {"completion_window": "balanced"}}, + {"service_tier": "auto", "extra_body": {"metadata": {"completion_window": "flex"}}}, ], - ids=["extra_body_balanced", "extra_body_flex", "metadata_balanced"], + ids=["extra_body_balanced", "extra_body_flex", "metadata_balanced", "auto_tier_flex_window"], ) def test_completion_window_in_optional_params_bills_at_tier_rates(self, optional_params: dict): rates = litellm.model_cost[MODEL]