Step 3.7 Flash is StepFun's latest high-efficiency multimodal Mixture-of-Experts model. It pairs a 196B-parameter language backbone with a vision encoder for native image and video understanding, activating roughly 11B parameters...

Details

FieldValue
idstepfun/step-3.7-flash
modalitytext+image+video->text
context_length256000
max_input_tokens256000
max_output_tokens230400
knowledge_cutoff2026-03-01
release_date2026-05-29
is_open_weightsyes
supports_tool_callyes
supports_reasoningyes
supports_structured_outputyes
supports_attachmentyes
input_modalitiestext, image, video
output_modalitiestext