Multimodal reasoning model for visual analysis, planning, and tool use
Details
| Field | Value |
|---|---|
| id | baidu/ernie-4.5-vl-424b-a47b |
| family | ernie |
| modality | image+text->text |
| context_length | 123000 |
| max_output_tokens | 16000 |
| release_date | 2025-06-30 |
| is_open_weights | no |
| supports_tool_call | no |
| supports_reasoning | yes |
| supports_structured_output | no |
| supports_attachment | yes |
| input_modalities | image, text |
| output_modalities | text |