StepFun's next-generation flagship base model for coding and professional knowledge work, with native text, image, and video input and a 1M-token context window

Details

FieldValue
idstep-5-preview
modalitytext+image+video->text
context_length1024000
max_output_tokens131072
release_date2026-09-16
is_open_weightsno
supports_tool_callyes
supports_reasoningyes
supports_structured_outputyes
supports_attachmentyes
input_modalitiestext, image, video
output_modalitiestext
Step 5 Preview