Qwen omni model for text, vision, audio, and multimodal agent tasks
Details
| Field | Value |
|---|---|
| id | qwen/qwen3-omni-30b-a3b-instruct |
| family | qwen |
| modality | text+video+audio+image->text+audio |
| context_length | 65536 |
| max_output_tokens | 16384 |
| knowledge_cutoff | 2024-04 |
| release_date | 2025-09-24 |
| is_open_weights | yes |
| supports_tool_call | yes |
| supports_reasoning | no |
| supports_structured_output | yes |
| supports_attachment | yes |
| input_modalities | text, video, audio, image |
| output_modalities | text, audio |