Multimodal model for analyzing text, images, documents, and rich media

Details

FieldValue
idbytedance/ui-tars-1.5-7b
modalityimage+text->text
context_length128000
max_output_tokens2048
release_date2025-07-22
is_open_weightsno
supports_tool_callno
supports_reasoningno
supports_structured_outputyes
supports_attachmentyes
input_modalitiesimage, text
output_modalitiestext

Providers