diff --git a/litellm/llms/gemini/realtime/transformation.py b/litellm/llms/gemini/realtime/transformation.py index aa99cc3695f..689f229e393 100644 --- a/litellm/llms/gemini/realtime/transformation.py +++ b/litellm/llms/gemini/realtime/transformation.py @@ -904,7 +904,7 @@ class GeminiRealtimeConfig(BaseRealtimeConfig): ) temperature = generation_config.get("temperature") max_output_tokens = generation_config.get("max_output_tokens") - gemini_modalities = generation_config.get("responseModalities", ["TEXT"]) + gemini_modalities = generation_config.get("responseModalities", ["AUDIO"]) _modalities = [ modality.lower() for modality in cast(List[str], gemini_modalities) ] diff --git a/tests/test_litellm/llms/gemini/realtime/test_gemini_realtime_transformation.py b/tests/test_litellm/llms/gemini/realtime/test_gemini_realtime_transformation.py index c95a085d17c..0e619a50872 100644 --- a/tests/test_litellm/llms/gemini/realtime/test_gemini_realtime_transformation.py +++ b/tests/test_litellm/llms/gemini/realtime/test_gemini_realtime_transformation.py @@ -265,9 +265,9 @@ def test_gemini_realtime_transformation_generation_complete(): contains_audio_done_event = False for response in responses: if response["type"] == OpenAIRealtimeEventTypes.RESPONSE_AUDIO_DONE.value: - contains_audio_delta = True + contains_audio_done_event = True break - assert contains_audio_delta, "Expected audio delta event" + assert contains_audio_done_event, "Expected audio done event" def test_gemini_3_1_flash_live_preview_model_cost_map_entry():