OpenAI gpt-oss-120b reasoning model, native MXFP4 (~65GB). Fits a single H100 80GB.

Results

Comparing 6 setups 11 config differences

hardwarevllm-gpt-oss-120b-a10gvllm-gpt-oss-120b-h200-bigcodevllm-gpt-oss-120b-b200-bigcodevllm-gpt-oss-120b-h100-bigcodevllm-gpt-oss-120b-4xa40-bigcodevllm-gpt-oss-120b-2xl40s-bigcode
enginevllmvllmvllmvllmvllmvllm
acceleratorsA10G:4H200-SXM:1B200:1H100-SXM:1A40:4L40S:2
parametervllm-gpt-oss-120b-a10gvllm-gpt-oss-120b-h200-bigcodevllm-gpt-oss-120b-b200-bigcodevllm-gpt-oss-120b-h100-bigcodevllm-gpt-oss-120b-4xa40-bigcodevllm-gpt-oss-120b-2xl40s-bigcode
NCCL_CUMEM_ENABLE00
NCCL_DEBUGINFOINFO
NCCL_P2P_DISABLE11
VLLM_USE_FLASHINFER_MOE_MXFP4_MXFP81
disable-custom-all-reducetruetrue
enable_auto_tool_choicetruetruetruetruetrue
enable-chunked-prefilltrue
gpu-memory-utilization0.9
max-model-len3276832768
tensor-parallel-size411142
tool_call_parseropenaiopenaiopenaiopenaiopenai
  • vllm-gpt-oss-120b-a10g
  • vllm-gpt-oss-120b-h200-bigcode
  • vllm-gpt-oss-120b-b200-bigcode
  • vllm-gpt-oss-120b-h100-bigcode
  • vllm-gpt-oss-120b-4xa40-bigcode
  • vllm-gpt-oss-120b-2xl40s-bigcode

Leaderboard

#chartsetuphardwareconfigtok/s$/1M completion
1vllm-gpt-oss-120b-b200-bigcodevllm · B200:1
TP=1+3

Parallelism

tensor-parallel-size
1

Number of tensor-parallel groups.

Environment

VLLM_USE_FLASHINFER_MOE_MXFP4_MXFP8
1

Other

enable_auto_tool_choice
true
tool_call_parser
openai
18,255$0.1046
2vllm-gpt-oss-120b-h200-bigcodevllm · H200-SXM:1
TP=1+2

Parallelism

tensor-parallel-size
1

Number of tensor-parallel groups.

Other

enable_auto_tool_choice
true
tool_call_parser
openai
14,426.4$0.0996
3vllm-gpt-oss-120b-h100-bigcodevllm · H100-SXM:1
TP=1+2

Parallelism

tensor-parallel-size
1

Number of tensor-parallel groups.

Other

enable_auto_tool_choice
true
tool_call_parser
openai
6,852.2$0.1425
4vllm-gpt-oss-120b-4xa40-bigcodevllm · A40:4
TP=4+7

Distributed

disable-custom-all-reduce
true

Disable custom all-reduce kernel and fall back to NCCL.

Model

max-model-len
32768

Context length (prompt + output). Supports k/m suffixes or auto to fit GPU memory.

Parallelism

tensor-parallel-size
4

Number of tensor-parallel groups.

Environment

NCCL_CUMEM_ENABLE
0
NCCL_DEBUG
INFO
NCCL_P2P_DISABLE
1

Other

enable_auto_tool_choice
true
tool_call_parser
openai
3,669.7$0.1566
5vllm-gpt-oss-120b-2xl40s-bigcodevllm · L40S:2
TP=2+7

Distributed

disable-custom-all-reduce
true

Disable custom all-reduce kernel and fall back to NCCL.

Model

max-model-len
32768

Context length (prompt + output). Supports k/m suffixes or auto to fit GPU memory.

Parallelism

tensor-parallel-size
2

Number of tensor-parallel groups.

Environment

NCCL_CUMEM_ENABLE
0
NCCL_DEBUG
INFO
NCCL_P2P_DISABLE
1

Other

enable_auto_tool_choice
true
tool_call_parser
openai
3,595.8$0.1839
6vllm-gpt-oss-120b-a10gvllm · A10G:4
TP=4 · chunked-prefill=true+1

KV cache

gpu-memory-utilization
0.9

Fraction of GPU memory for the model executor (0–1). Per-instance limit.

Parallelism

tensor-parallel-size
4

Number of tensor-parallel groups.

Scheduler

enable-chunked-prefill
true

Chunk long prefills based on remaining batched-token budget.

758.2$2.4265