Merge pull request #37722 from BerriAI/litellm_gpt56_max_input_tokens

fix(model-costs): correct gpt-5.6 max input tokens to 922k
This commit is contained in:
Mateo Wang 2026-08-20 17:21:09 -07:00 committed by GitHub
commit fb3dd0fb98
No known key found for this signature in database
GPG key ID: B5690EEEBB952194
3 changed files with 34 additions and 33 deletions

View file

@ -6510,7 +6510,7 @@
"input_cost_per_token_priority": 1e-05,
"input_cost_per_token_above_272k_tokens_priority": 2e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6561,7 +6561,7 @@
"input_cost_per_token_priority": 1e-05,
"input_cost_per_token_above_272k_tokens_priority": 2e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6612,7 +6612,7 @@
"input_cost_per_token_priority": 4e-06,
"input_cost_per_token_above_272k_tokens_priority": 8e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6663,7 +6663,7 @@
"input_cost_per_token_priority": 4e-07,
"input_cost_per_token_above_272k_tokens_priority": 8e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6711,7 +6711,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6759,7 +6759,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6807,7 +6807,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-06,
"input_cost_per_token_priority": 5.5e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6855,7 +6855,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-07,
"input_cost_per_token_priority": 5.5e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6902,7 +6902,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6950,7 +6950,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6998,7 +6998,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-06,
"input_cost_per_token_priority": 5.5e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -7046,7 +7046,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-07,
"input_cost_per_token_priority": 5.5e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25333,7 +25333,7 @@
"input_cost_per_token_flex": 2.5e-06,
"input_cost_per_token_priority": 1e-05,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25396,7 +25396,7 @@
"input_cost_per_token_flex": 2.5e-06,
"input_cost_per_token_priority": 1e-05,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25459,7 +25459,7 @@
"input_cost_per_token_flex": 1e-06,
"input_cost_per_token_priority": 4e-06,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25522,7 +25522,7 @@
"input_cost_per_token_flex": 1e-07,
"input_cost_per_token_priority": 4e-07,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",

View file

@ -6510,7 +6510,7 @@
"input_cost_per_token_priority": 1e-05,
"input_cost_per_token_above_272k_tokens_priority": 2e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6561,7 +6561,7 @@
"input_cost_per_token_priority": 1e-05,
"input_cost_per_token_above_272k_tokens_priority": 2e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6612,7 +6612,7 @@
"input_cost_per_token_priority": 4e-06,
"input_cost_per_token_above_272k_tokens_priority": 8e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6663,7 +6663,7 @@
"input_cost_per_token_priority": 4e-07,
"input_cost_per_token_above_272k_tokens_priority": 8e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6711,7 +6711,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6759,7 +6759,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6807,7 +6807,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-06,
"input_cost_per_token_priority": 5.5e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6855,7 +6855,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-07,
"input_cost_per_token_priority": 5.5e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6902,7 +6902,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6950,7 +6950,7 @@
"input_cost_per_token_above_272k_tokens": 1.1e-05,
"input_cost_per_token_priority": 1.375e-05,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -6998,7 +6998,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-06,
"input_cost_per_token_priority": 5.5e-06,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -7046,7 +7046,7 @@
"input_cost_per_token_above_272k_tokens": 4.4e-07,
"input_cost_per_token_priority": 5.5e-07,
"litellm_provider": "azure",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25333,7 +25333,7 @@
"input_cost_per_token_flex": 2.5e-06,
"input_cost_per_token_priority": 1e-05,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25396,7 +25396,7 @@
"input_cost_per_token_flex": 2.5e-06,
"input_cost_per_token_priority": 1e-05,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25459,7 +25459,7 @@
"input_cost_per_token_flex": 1e-06,
"input_cost_per_token_priority": 4e-06,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",
@ -25522,7 +25522,7 @@
"input_cost_per_token_flex": 1e-07,
"input_cost_per_token_priority": 4e-07,
"litellm_provider": "openai",
"max_input_tokens": 1050000,
"max_input_tokens": 922000,
"max_output_tokens": 128000,
"max_tokens": 128000,
"mode": "chat",

View file

@ -941,7 +941,7 @@ def test_generic_cost_per_token_gpt56(
assert model_cost_map["cache_creation_input_token_cost"] == pytest.approx(
input_cost * 1.25
)
assert model_cost_map["max_input_tokens"] == 1050000
assert model_cost_map["max_input_tokens"] == 922000
assert model_cost_map["input_cost_per_token_above_272k_tokens"] == pytest.approx(
input_cost * 2
)
@ -1082,6 +1082,7 @@ def test_generic_cost_per_token_azure_gpt56(
assert model_cost_map["input_cost_per_token"] == input_cost
assert model_cost_map["output_cost_per_token"] == output_cost
assert model_cost_map["cache_read_input_token_cost"] == cache_read_cost
assert model_cost_map["max_input_tokens"] == 922000
prompt_tokens = 1000
completion_tokens = 500