Tok/s vs cost benchmarks for running open models yourself, across GPUs and inference engines.
- MiniMax-M3 — Tok/s vs cost of self-hosting MiniMaxAI/MiniMax-M3 on H200:8.
- MiMo-V2.6-Flash-RL — Tok/s vs cost of self-hosting XiaomiMiMo/MiMo-V2.6-Flash-RL on H200:8.
- step3p7-flash — Tok/s vs cost of self-hosting step3p7-flash on H200:8.
- DeepSeek-V4-Flash-0731 — Tok/s vs cost of self-hosting deepseek-ai/DeepSeek-V4-Flash-0731 on H100:8.
- gpt-oss-20b — Tok/s vs cost of self-hosting openai/gpt-oss-20b on L4:1.
- DeepSeek-V4-Pro-0813 — Tok/s vs cost of self-hosting deepseek-ai/DeepSeek-V4-Pro-0813 on H200:8.
- DeepSeek-V4.1-Flash — Tok/s vs cost of self-hosting deepseek-ai/DeepSeek-V4.1-Flash on H100:8, H200:8.
- Ling-3.0-flash-fp8 — Tok/s vs cost of self-hosting inclusionAI/Ling-3.0-flash-fp8 on H200:8.