From 90121f62782ba247ae670be22cd3085147264d83 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Thu, 30 Jul 2026 16:12:47 -0400 Subject: [PATCH 01/15] feat: add MiniMax M3 NVFP4 B200 Dynamo vLLM disaggregated EAGLE3 recipes MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Port the B300 MTP EAGLE3 recipe set (PR #2182) to B200: - Six srt-slurm recipe YAMLs under b200-fp4/8k1k/mtp/ (gpu_type: b200) - minimaxm3-fp4-b200-dynamo-vllm-mtp master-config entry (runner: b200-multinode) - perf-changelog entry to trigger the sweep 中文:将 B300 MTP EAGLE3 配方集(PR #2182)移植到 B200: - 在 b200-fp4/8k1k/mtp/ 下新增六个 srt-slurm 配方 YAML(gpu_type: b200) - 新增 minimaxm3-fp4-b200-dynamo-vllm-mtp 主配置条目(runner: b200-multinode) - 新增 perf-changelog 条目以触发扫描 Co-Authored-By: Claude Sonnet 4.6 (1M context) --- .../8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml | 96 +++++++++++++++++ .../8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ configs/nvidia-master.yaml | 102 ++++++++++++++++++ perf-changelog.yaml | 6 ++ 8 files changed, 674 insertions(+) create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..ad2f710550 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p1d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 0 + prefill_workers: 1 + decode_workers: 1 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..20f24c7c54 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p2d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 1 + prefill_workers: 1 + decode_workers: 2 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "4x32x64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..b5d36d7b6d --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p4d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 2 + prefill_workers: 1 + decode_workers: 4 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "4x8x64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..e91b86e4da --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p6d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 3 + prefill_workers: 1 + decode_workers: 6 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "24x48" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..9d19296144 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml @@ -0,0 +1,96 @@ +name: "minimax-m3-vllm-disagg-b200-2p1d-dep2-dep4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 0 + prefill_workers: 2 + decode_workers: 1 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.9 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "256x512" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..01a4cc8db1 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-2p3d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 1 + prefill_workers: 2 + decode_workers: 3 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "192" diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index a30af59641..e4c3c51200 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7481,6 +7481,108 @@ minimaxm3-fp4-b200-dynamo-vllm: ep: 1 dp-attn: false +minimaxm3-fp4-b200-dynamo-vllm-mtp: + image: vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 + model: nvidia/MiniMax-M3-NVFP4 + model-prefix: minimaxm3 + runner: b200-multinode + precision: fp4 + framework: dynamo-vllm + router: { name: dynamo-router, version: "1.3.0.dev20260710" } + kv-p2p-transfer: nixl + multinode: true + disagg: true + scenarios: + fixed-seq-len: + - isl: 8192 + osl: 1024 + search-space: + - spec-decoding: "mtp" + conc-list: [24, 48] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 6 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [4, 8, 64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 4 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [4, 32, 64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 2 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 1 + tp: 4 + ep: 1 + dp-attn: false + + - spec-decoding: "mtp" + conc-list: [192] + prefill: + num-worker: 2 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 3 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [256, 512] + prefill: + num-worker: 2 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml" + decode: + num-worker: 1 + tp: 4 + ep: 4 + dp-attn: true + # MiniMax-M3 NVFP4 disagg sweep on the same B300 topology matrix as the MXFP8 # baseline above. The image includes vLLM PR #46380, so no runtime patch is # needed. diff --git a/perf-changelog.yaml b/perf-changelog.yaml index 4c22ed9198..eb1ef99b1a 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5347,3 +5347,9 @@ - "Add seven checked-in srt-slurm recipes selected one-to-one by the 8K/1K prefill/decode topology and concurrency entries." - "Image: vllm/vllm-openai:v0.25.1" pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2360 + +- config-keys: + - minimaxm3-fp4-b200-dynamo-vllm-mtp + description: + - "Add MiniMax M3 NVFP4 B200 Dynamo-vLLM disaggregated EAGLE3 recipes" + pr-link: TBD From 3bcb1e87a368540b8e451693be9d97d503d0a9f0 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Thu, 30 Jul 2026 16:13:28 -0400 Subject: [PATCH 02/15] chore: fill perf-changelog pr-link for minimaxm3-fp4-b200-dynamo-vllm-mtp MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 中文:补全 minimaxm3-fp4-b200-dynamo-vllm-mtp 的 perf-changelog pr-link Co-Authored-By: Claude Sonnet 4.6 (1M context) --- perf-changelog.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/perf-changelog.yaml b/perf-changelog.yaml index eb1ef99b1a..04bd94fcac 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5352,4 +5352,4 @@ - minimaxm3-fp4-b200-dynamo-vllm-mtp description: - "Add MiniMax M3 NVFP4 B200 Dynamo-vLLM disaggregated EAGLE3 recipes" - pr-link: TBD + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2431 From 356d87e8b887ebb6446371bcff0b65d00345b86f Mon Sep 17 00:00:00 2001 From: Xin Li Date: Thu, 30 Jul 2026 19:25:20 -0400 Subject: [PATCH 03/15] fix: update B200 fp4 MTP image to vllm/vllm-openai:v0.26.0 MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 中文:将 B200 fp4 MTP 镜像更新为 vllm/vllm-openai:v0.26.0 Co-Authored-By: Claude Sonnet 4.6 (1M context) --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml | 2 +- configs/nvidia-master.yaml | 2 +- 7 files changed, 7 insertions(+), 7 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml index ad2f710550..e971ffbb08 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p1d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml index 20f24c7c54..1a4db419f8 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p2d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml index b5d36d7b6d..7761b09c46 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p4d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml index e91b86e4da..ff68bcb87c 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p6d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml index 9d19296144..4482853850 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-2p1d-dep2-dep4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml index 01a4cc8db1..090466d560 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-2p3d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:v0.26.0" precision: fp4 resources: diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index e4c3c51200..2805935d83 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7482,7 +7482,7 @@ minimaxm3-fp4-b200-dynamo-vllm: dp-attn: false minimaxm3-fp4-b200-dynamo-vllm-mtp: - image: vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 + image: vllm/vllm-openai:v0.26.0 model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 runner: b200-multinode From 78c78a2aab0b98b0d1e48ad0765d4fe1711b9ef6 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Fri, 31 Jul 2026 00:03:24 -0400 Subject: [PATCH 04/15] fix: update B200 fp4 MTP image to nightly-6f91edf96d3f3272945809c04702380053bff4de MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 中文:将 B200 fp4 MTP 镜像更新为 nightly-6f91edf96d3f3272945809c04702380053bff4de Co-Authored-By: Claude Sonnet 4.6 (1M context) --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml | 2 +- configs/nvidia-master.yaml | 2 +- 7 files changed, 7 insertions(+), 7 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml index e971ffbb08..8cc390fbee 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p1d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml index 1a4db419f8..c77a46a324 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p2d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml index 7761b09c46..0347f11a07 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p4d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml index ff68bcb87c..72c05f7179 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-1p6d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml index 4482853850..c3a4fa49c8 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-2p1d-dep2-dep4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml index 090466d560..d95f158210 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b200-2p3d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:v0.26.0" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" precision: fp4 resources: diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 2805935d83..3801686e87 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7482,7 +7482,7 @@ minimaxm3-fp4-b200-dynamo-vllm: dp-attn: false minimaxm3-fp4-b200-dynamo-vllm-mtp: - image: vllm/vllm-openai:v0.26.0 + image: vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 runner: b200-multinode From 9aa51d9a281eb097d2b94c2752fb6a5dab091e96 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Fri, 31 Jul 2026 09:45:47 -0400 Subject: [PATCH 05/15] restore mtp recipes, switch 2xDEP2 prefill to 1xDEP4 --- .../8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml | 96 +++++++++++++++++ .../8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ .../8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml | 94 ++++++++++++++++ configs/nvidia-master.yaml | 101 ++++++++++++++++++ 7 files changed, 667 insertions(+) create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..8cc390fbee --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p1d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 0 + prefill_workers: 1 + decode_workers: 1 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..e8487333d2 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml @@ -0,0 +1,96 @@ +name: "minimax-m3-vllm-disagg-b200-1p1d-dep4-dep4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 0 + prefill_workers: 1 + decode_workers: 1 + gpus_per_prefill: 4 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.9 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "256x512" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..c77a46a324 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p2d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 1 + prefill_workers: 1 + decode_workers: 2 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "4x32x64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..c011f00f8a --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p3d-dep4-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 1 + prefill_workers: 1 + decode_workers: 3 + gpus_per_prefill: 4 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "192" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..0347f11a07 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p4d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 2 + prefill_workers: 1 + decode_workers: 4 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "4x8x64" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml new file mode 100644 index 0000000000..72c05f7179 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p6d-dep2-tp4-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 3 + prefill_workers: 1 + decode_workers: 6 + gpus_per_prefill: 2 + gpus_per_decode: 4 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 2 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 4 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "24x48" diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index a30af59641..587993e12b 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7481,6 +7481,107 @@ minimaxm3-fp4-b200-dynamo-vllm: ep: 1 dp-attn: false +minimaxm3-fp4-b200-dynamo-vllm-mtp: + image: vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de + model: nvidia/MiniMax-M3-NVFP4 + model-prefix: minimaxm3 + runner: b200-multinode + precision: fp4 + framework: dynamo-vllm + router: { name: dynamo-router, version: "1.3.0.dev20260710" } + kv-p2p-transfer: nixl + multinode: true + disagg: true + scenarios: + fixed-seq-len: + - isl: 8192 + osl: 1024 + search-space: + - spec-decoding: "mtp" + conc-list: [24, 48] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 6 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [4, 8, 64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 4 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [4, 32, 64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 2 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [64] + prefill: + num-worker: 1 + tp: 2 + ep: 2 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 1 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [192] + prefill: + num-worker: 1 + tp: 4 + ep: 4 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml" + decode: + num-worker: 3 + tp: 4 + ep: 1 + dp-attn: false + - spec-decoding: "mtp" + conc-list: [256, 512] + prefill: + num-worker: 1 + tp: 4 + ep: 4 + dp-attn: true + additional-settings: + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml" + decode: + num-worker: 1 + tp: 4 + ep: 4 + dp-attn: true + # MiniMax-M3 NVFP4 disagg sweep on the same B300 topology matrix as the MXFP8 # baseline above. The image includes vLLM PR #46380, so no runtime patch is # needed. From ad50a2545b6a83ffade8ee783b2518bdb78d6c71 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 01:26:50 -0400 Subject: [PATCH 06/15] redesign B200 MTP sweep: 1P DEP4 prefill, 1D/2D/4D x TP4/TP8 decode, conc 1-1024 --- .../8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml | 96 ------------------- ...1k.yaml => 1p1d-dep4-tp4-eagle3-8k1k.yaml} | 10 +- .../8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 94 ++++++++++++++++++ ...1k.yaml => 1p2d-dep4-tp4-eagle3-8k1k.yaml} | 8 +- ...1k.yaml => 1p2d-dep4-tp8-eagle3-8k1k.yaml} | 16 ++-- ...1k.yaml => 1p4d-dep4-tp4-eagle3-8k1k.yaml} | 10 +- .../8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 94 ++++++++++++++++++ .../8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml | 94 ------------------ configs/nvidia-master.yaml | 64 ++++++------- 9 files changed, 240 insertions(+), 246 deletions(-) delete mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/{1p1d-dep2-tp4-eagle3-8k1k.yaml => 1p1d-dep4-tp4-eagle3-8k1k.yaml} (91%) create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/{1p3d-dep4-tp4-eagle3-8k1k.yaml => 1p2d-dep4-tp4-eagle3-8k1k.yaml} (92%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/{1p2d-dep2-tp4-eagle3-8k1k.yaml => 1p2d-dep4-tp8-eagle3-8k1k.yaml} (89%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/{1p4d-dep2-tp4-eagle3-8k1k.yaml => 1p4d-dep4-tp4-eagle3-8k1k.yaml} (91%) create mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml delete mode 100644 benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml deleted file mode 100644 index e8487333d2..0000000000 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml +++ /dev/null @@ -1,96 +0,0 @@ -name: "minimax-m3-vllm-disagg-b200-1p1d-dep4-dep4-fp4-8k1k-eagle3" - -model: - path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" - precision: fp4 - -resources: - gpu_type: b200 - gpus_per_node: 8 - prefill_nodes: 1 - decode_nodes: 0 - prefill_workers: 1 - decode_workers: 1 - gpus_per_prefill: 4 - gpus_per_decode: 4 - -dynamo: - install: true - version: 1.3.0.dev20260710 - -frontend: - type: dynamo - enable_multiple_frontends: false - -backend: - type: vllm - connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true - - prefill_environment: - VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm - UCX_TLS: cuda_copy,cuda_ipc,rc - - decode_environment: - VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm - UCX_TLS: cuda_copy,cuda_ipc,rc - - vllm_config: - prefill: - no-enable-flashinfer-autotune: true - tensor-parallel-size: 1 - pipeline-parallel-size: 1 - data-parallel-size: 4 - data-parallel-rpc-port: 13345 - enable-expert-parallel: true - trust-remote-code: true - no-enable-prefix-caching: true - kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' - attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' - block-size: 128 - gpu-memory-utilization: 0.95 - max-model-len: 9472 - language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' - stream-interval: 32 - max-cudagraph-capture-size: 2048 - max-num-batched-tokens: 16384 - - decode: - no-enable-flashinfer-autotune: true - tensor-parallel-size: 1 - pipeline-parallel-size: 1 - data-parallel-size: 4 - data-parallel-rpc-port: 13345 - enable-expert-parallel: true - trust-remote-code: true - no-enable-prefix-caching: true - kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' - attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' - block-size: 128 - gpu-memory-utilization: 0.9 - max-model-len: 9472 - language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' - stream-interval: 32 - max-num-seqs: 1024 - max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 - -health_check: - max_attempts: 360 - interval_seconds: 10 - -benchmark: - type: sa-bench - isl: 8192 - osl: 1024 - req_rate: inf - num_warmup_mult: 0 - random_range_ratio: 0.8 - use_chat_template: true - concurrencies: "256x512" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml similarity index 91% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 8cc390fbee..4331d7e953 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p1d-dep2-tp4-fp4-8k1k-eagle3" +name: "minimax-m3-vllm-disagg-b200-1p1d-dep4-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" @@ -12,7 +12,7 @@ resources: decode_nodes: 0 prefill_workers: 1 decode_workers: 1 - gpus_per_prefill: 2 + gpus_per_prefill: 4 gpus_per_decode: 4 dynamo: @@ -44,7 +44,7 @@ backend: no-enable-flashinfer-autotune: true tensor-parallel-size: 1 pipeline-parallel-size: 1 - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 enable-expert-parallel: true trust-remote-code: true @@ -55,7 +55,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 @@ -91,4 +91,4 @@ benchmark: num_warmup_mult: 0 random_range_ratio: 0.8 use_chat_template: true - concurrencies: "64" + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml new file mode 100644 index 0000000000..9f674442a1 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p1d-dep4-tp8-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 1 + prefill_workers: 1 + decode_workers: 1 + gpus_per_prefill: 4 + gpus_per_decode: 8 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 8 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml similarity index 92% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index c011f00f8a..ddf3247b5f 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p3d-dep4-tp4-fp4-8k1k-eagle3" +name: "minimax-m3-vllm-disagg-b200-1p2d-dep4-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" @@ -11,7 +11,7 @@ resources: prefill_nodes: 1 decode_nodes: 1 prefill_workers: 1 - decode_workers: 3 + decode_workers: 2 gpus_per_prefill: 4 gpus_per_decode: 4 @@ -55,7 +55,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 @@ -91,4 +91,4 @@ benchmark: num_warmup_mult: 0 random_range_ratio: 0.8 use_chat_template: true - concurrencies: "192" + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml similarity index 89% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index c77a46a324..ec7b15d4ad 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p2d-dep2-tp4-fp4-8k1k-eagle3" +name: "minimax-m3-vllm-disagg-b200-1p2d-dep4-tp8-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" @@ -9,11 +9,11 @@ resources: gpu_type: b200 gpus_per_node: 8 prefill_nodes: 1 - decode_nodes: 1 + decode_nodes: 2 prefill_workers: 1 decode_workers: 2 - gpus_per_prefill: 2 - gpus_per_decode: 4 + gpus_per_prefill: 4 + gpus_per_decode: 8 dynamo: install: true @@ -44,7 +44,7 @@ backend: no-enable-flashinfer-autotune: true tensor-parallel-size: 1 pipeline-parallel-size: 1 - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 enable-expert-parallel: true trust-remote-code: true @@ -55,14 +55,14 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 decode: no-enable-flashinfer-autotune: true - tensor-parallel-size: 4 + tensor-parallel-size: 8 pipeline-parallel-size: 1 enable-expert-parallel: false trust-remote-code: true @@ -91,4 +91,4 @@ benchmark: num_warmup_mult: 0 random_range_ratio: 0.8 use_chat_template: true - concurrencies: "4x32x64" + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml similarity index 91% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index 0347f11a07..b8364cd66e 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p4d-dep2-tp4-fp4-8k1k-eagle3" +name: "minimax-m3-vllm-disagg-b200-1p4d-dep4-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" @@ -12,7 +12,7 @@ resources: decode_nodes: 2 prefill_workers: 1 decode_workers: 4 - gpus_per_prefill: 2 + gpus_per_prefill: 4 gpus_per_decode: 4 dynamo: @@ -44,7 +44,7 @@ backend: no-enable-flashinfer-autotune: true tensor-parallel-size: 1 pipeline-parallel-size: 1 - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 enable-expert-parallel: true trust-remote-code: true @@ -55,7 +55,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 @@ -91,4 +91,4 @@ benchmark: num_warmup_mult: 0 random_range_ratio: 0.8 use_chat_template: true - concurrencies: "4x8x64" + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml new file mode 100644 index 0000000000..746fc98816 --- /dev/null +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -0,0 +1,94 @@ +name: "minimax-m3-vllm-disagg-b200-1p4d-dep4-tp8-fp4-8k1k-eagle3" + +model: + path: "nvidia/MiniMax-M3-NVFP4" + container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" + precision: fp4 + +resources: + gpu_type: b200 + gpus_per_node: 8 + prefill_nodes: 1 + decode_nodes: 4 + prefill_workers: 1 + decode_workers: 4 + gpus_per_prefill: 4 + gpus_per_decode: 8 + +dynamo: + install: true + version: 1.3.0.dev20260710 + +frontend: + type: dynamo + enable_multiple_frontends: false + +backend: + type: vllm + connector: null + allow_prefill_decode_colocation: true + allow_prefill_decode_colocation_across_nodes: true + + prefill_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + decode_environment: + VLLM_FLOAT32_MATMUL_PRECISION: high + VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm + UCX_TLS: cuda_copy,cuda_ipc,rc + + vllm_config: + prefill: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 1 + pipeline-parallel-size: 1 + data-parallel-size: 4 + data-parallel-rpc-port: 13345 + enable-expert-parallel: true + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-cudagraph-capture-size: 2048 + max-num-batched-tokens: 16384 + + decode: + no-enable-flashinfer-autotune: true + tensor-parallel-size: 8 + pipeline-parallel-size: 1 + enable-expert-parallel: false + trust-remote-code: true + no-enable-prefix-caching: true + kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + block-size: 128 + gpu-memory-utilization: 0.95 + max-model-len: 9472 + language-model-only: true + speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' + stream-interval: 32 + max-num-seqs: 1024 + max-num-batched-tokens: 16384 + max-cudagraph-capture-size: 2048 + +health_check: + max_attempts: 360 + interval_seconds: 10 + +benchmark: + type: sa-bench + isl: 8192 + osl: 1024 + req_rate: inf + num_warmup_mult: 0 + random_range_ratio: 0.8 + use_chat_template: true + concurrencies: "1x2x4x8x16x32x64x128x256x512x1024" diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml deleted file mode 100644 index 72c05f7179..0000000000 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml +++ /dev/null @@ -1,94 +0,0 @@ -name: "minimax-m3-vllm-disagg-b200-1p6d-dep2-tp4-fp4-8k1k-eagle3" - -model: - path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de" - precision: fp4 - -resources: - gpu_type: b200 - gpus_per_node: 8 - prefill_nodes: 1 - decode_nodes: 3 - prefill_workers: 1 - decode_workers: 6 - gpus_per_prefill: 2 - gpus_per_decode: 4 - -dynamo: - install: true - version: 1.3.0.dev20260710 - -frontend: - type: dynamo - enable_multiple_frontends: false - -backend: - type: vllm - connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true - - prefill_environment: - VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm - UCX_TLS: cuda_copy,cuda_ipc,rc - - decode_environment: - VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm - UCX_TLS: cuda_copy,cuda_ipc,rc - - vllm_config: - prefill: - no-enable-flashinfer-autotune: true - tensor-parallel-size: 1 - pipeline-parallel-size: 1 - data-parallel-size: 2 - data-parallel-rpc-port: 13345 - enable-expert-parallel: true - trust-remote-code: true - no-enable-prefix-caching: true - kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' - attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' - block-size: 128 - gpu-memory-utilization: 0.95 - max-model-len: 9472 - language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":1,"attention_backend":"FLASH_ATTN"}' - stream-interval: 32 - max-cudagraph-capture-size: 2048 - max-num-batched-tokens: 16384 - - decode: - no-enable-flashinfer-autotune: true - tensor-parallel-size: 4 - pipeline-parallel-size: 1 - enable-expert-parallel: false - trust-remote-code: true - no-enable-prefix-caching: true - kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' - attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' - block-size: 128 - gpu-memory-utilization: 0.95 - max-model-len: 9472 - language-model-only: true - speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' - stream-interval: 32 - max-num-seqs: 1024 - max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 - -health_check: - max_attempts: 360 - interval_seconds: 10 - -benchmark: - type: sa-bench - isl: 8192 - osl: 1024 - req_rate: inf - num_warmup_mult: 0 - random_range_ratio: 0.8 - use_chat_template: true - concurrencies: "24x48" diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 587993e12b..348b4c62ab 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7498,93 +7498,89 @@ minimaxm3-fp4-b200-dynamo-vllm-mtp: osl: 1024 search-space: - spec-decoding: "mtp" - conc-list: [24, 48] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml" decode: - num-worker: 6 + num-worker: 1 tp: 4 ep: 1 dp-attn: false - spec-decoding: "mtp" - conc-list: [4, 8, 64] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml" decode: - num-worker: 4 - tp: 4 + num-worker: 1 + tp: 8 ep: 1 dp-attn: false - spec-decoding: "mtp" - conc-list: [4, 32, 64] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml" decode: num-worker: 2 tp: 4 ep: 1 dp-attn: false - spec-decoding: "mtp" - conc-list: [64] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml" decode: - num-worker: 1 - tp: 4 + num-worker: 2 + tp: 8 ep: 1 dp-attn: false - spec-decoding: "mtp" - conc-list: [192] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 tp: 4 ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p3d-dep4-tp4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml" decode: - num-worker: 3 + num-worker: 4 tp: 4 ep: 1 dp-attn: false - spec-decoding: "mtp" - conc-list: [256, 512] + conc-list: [1, 2, 4, 8, 16, 32, 64, 128, 256, 512, 1024] prefill: num-worker: 1 tp: 4 ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-dep4-eagle3-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml" decode: - num-worker: 1 - tp: 4 - ep: 4 - dp-attn: true - -# MiniMax-M3 NVFP4 disagg sweep on the same B300 topology matrix as the MXFP8 -# baseline above. The image includes vLLM PR #46380, so no runtime patch is -# needed. + num-worker: 4 + tp: 8 + ep: 1 + dp-attn: false minimaxm3-fp8-b300-dynamo-vllm: image: vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9 model: MiniMaxAI/MiniMax-M3-MXFP8 From bb3000857eadf74a9aeea378f8bfddba66577183 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 08:06:34 -0400 Subject: [PATCH 07/15] runner: b200-new --- configs/nvidia-master.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 348b4c62ab..d310ba5cdb 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7485,7 +7485,7 @@ minimaxm3-fp4-b200-dynamo-vllm-mtp: image: vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 - runner: b200-multinode + runner: b200-new precision: fp4 framework: dynamo-vllm router: { name: dynamo-router, version: "1.3.0.dev20260710" } From 769953d963a0ae3d6677172fd6b1013decc457c6 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 08:16:27 -0400 Subject: [PATCH 08/15] revert runner to b200-multinode --- configs/nvidia-master.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index d310ba5cdb..348b4c62ab 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7485,7 +7485,7 @@ minimaxm3-fp4-b200-dynamo-vllm-mtp: image: vllm/vllm-openai:nightly-6f91edf96d3f3272945809c04702380053bff4de model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 - runner: b200-new + runner: b200-multinode precision: fp4 framework: dynamo-vllm router: { name: dynamo-router, version: "1.3.0.dev20260710" } From 814998813fd909014ef8a0d57c88fcfceea65837 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 22:44:45 -0400 Subject: [PATCH 09/15] upgrade non-MTP B200 disagg prefill from DEP2 to DEP4 (4 GPUs per serving instance) --- ...1k.yaml => 1p1d-dep4-tp4-c1-c16-8k1k.yaml} | 6 ++-- ...-8k1k.yaml => 1p2d-dep4-tp4-c64-8k1k.yaml} | 6 ++-- ...8k1k.yaml => 2p2d-dep4-tp4-c128-8k1k.yaml} | 8 ++--- ...8k1k.yaml => 3p2d-dep4-tp4-c256-8k1k.yaml} | 8 ++--- ...8k1k.yaml => 3p2d-dep4-tp4-c512-8k1k.yaml} | 8 ++--- ...k1k.yaml => 4p2d-dep4-tp4-c1024-8k1k.yaml} | 8 ++--- configs/nvidia-master.yaml | 36 +++++++++---------- 7 files changed, 40 insertions(+), 40 deletions(-) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{1p1d-dep2-tp4-c1-c16-8k1k.yaml => 1p1d-dep4-tp4-c1-c16-8k1k.yaml} (95%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{1p2d-dep2-tp4-c64-8k1k.yaml => 1p2d-dep4-tp4-c64-8k1k.yaml} (97%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{2p2d-dep2-tp4-c128-8k1k.yaml => 2p2d-dep4-tp4-c128-8k1k.yaml} (96%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{3p2d-dep2-tp4-c256-8k1k.yaml => 3p2d-dep4-tp4-c256-8k1k.yaml} (96%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{3p2d-dep2-tp4-c512-8k1k.yaml => 3p2d-dep4-tp4-c512-8k1k.yaml} (96%) rename benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/{4p2d-dep2-tp4-c1024-8k1k.yaml => 4p2d-dep4-tp4-c1024-8k1k.yaml} (96%) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep2-tp4-c1-c16-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml similarity index 95% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep2-tp4-c1-c16-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml index d28f594bae..17450bff62 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep2-tp4-c1-c16-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p1d-fp4-dep2-tp4-8k1k" +name: "minimax-m3-vllm-disagg-b200-1p1d-fp4-dep4-tp4-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" @@ -10,7 +10,7 @@ resources: decode_nodes: 1 prefill_workers: 1 decode_workers: 1 - gpus_per_prefill: 2 + gpus_per_prefill: 4 gpus_per_decode: 4 dynamo: {install: true, version: 1.3.0.dev20260710} frontend: {type: dynamo, enable_multiple_frontends: false} @@ -25,7 +25,7 @@ backend: served-model-name: nvidia/MiniMax-M3-NVFP4 no-enable-flashinfer-autotune: true tensor-parallel-size: 1 - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 enable-expert-parallel: true trust-remote-code: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep2-tp4-c64-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml similarity index 97% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep2-tp4-c64-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml index 7545f73b29..f5d85bb589 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep2-tp4-c64-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml @@ -1,4 +1,4 @@ -name: "minimax-m3-vllm-disagg-b200-1p2d-fp4-dep2-tp4-c64-8k1k" +name: "minimax-m3-vllm-disagg-b200-1p2d-fp4-dep4-tp4-c64-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" @@ -7,7 +7,7 @@ resources: gpu_type: "b200" prefill_nodes: 1 prefill_workers: 1 - gpus_per_prefill: 2 + gpus_per_prefill: 4 decode_nodes: 2 decode_workers: 2 spread_workers: true @@ -70,7 +70,7 @@ backend: tensor-parallel-size: 1 pipeline-parallel-size: 1 enable-expert-parallel: true - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 data-parallel-hybrid-lb: true max-model-len: 9472 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep2-tp4-c128-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml similarity index 96% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep2-tp4-c128-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml index 4614abeae0..792bfb3d0b 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep2-tp4-c128-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml @@ -1,13 +1,13 @@ -name: "minimax-m3-vllm-disagg-b200-2p2d-fp4-dep2-tp4-c128-8k1k" +name: "minimax-m3-vllm-disagg-b200-2p2d-fp4-dep4-tp4-c128-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: "fp4" resources: gpu_type: "b200" - prefill_nodes: 2 + prefill_nodes: 1 prefill_workers: 2 - gpus_per_prefill: 2 + gpus_per_prefill: 4 decode_nodes: 2 decode_workers: 2 spread_workers: true @@ -70,7 +70,7 @@ backend: tensor-parallel-size: 1 pipeline-parallel-size: 1 enable-expert-parallel: true - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 data-parallel-hybrid-lb: true max-model-len: 9472 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c256-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml similarity index 96% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c256-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml index 8cfb3eb300..a35ba5fd22 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c256-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml @@ -1,13 +1,13 @@ -name: "minimax-m3-vllm-disagg-b200-3p2d-fp4-dep2-tp4-c256-8k1k" +name: "minimax-m3-vllm-disagg-b200-3p2d-fp4-dep4-tp4-c256-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: "fp4" resources: gpu_type: "b200" - prefill_nodes: 3 + prefill_nodes: 2 prefill_workers: 3 - gpus_per_prefill: 2 + gpus_per_prefill: 4 decode_nodes: 2 decode_workers: 2 spread_workers: true @@ -70,7 +70,7 @@ backend: tensor-parallel-size: 1 pipeline-parallel-size: 1 enable-expert-parallel: true - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 data-parallel-hybrid-lb: true max-model-len: 9472 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c512-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml similarity index 96% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c512-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml index bf9f0d7e59..7fb126691c 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c512-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml @@ -1,13 +1,13 @@ -name: "minimax-m3-vllm-disagg-b200-3p2d-fp4-dep2-tp4-c512-8k1k" +name: "minimax-m3-vllm-disagg-b200-3p2d-fp4-dep4-tp4-c512-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: "fp4" resources: gpu_type: "b200" - prefill_nodes: 3 + prefill_nodes: 2 prefill_workers: 3 - gpus_per_prefill: 2 + gpus_per_prefill: 4 decode_nodes: 2 decode_workers: 2 spread_workers: true @@ -70,7 +70,7 @@ backend: tensor-parallel-size: 1 pipeline-parallel-size: 1 enable-expert-parallel: true - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 data-parallel-hybrid-lb: true max-model-len: 9472 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep2-tp4-c1024-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml similarity index 96% rename from benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep2-tp4-c1024-8k1k.yaml rename to benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml index ff366b74eb..616259328d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep2-tp4-c1024-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml @@ -1,13 +1,13 @@ -name: "minimax-m3-vllm-disagg-b200-4p2d-fp4-dep2-tp4-c1024-8k1k" +name: "minimax-m3-vllm-disagg-b200-4p2d-fp4-dep4-tp4-c1024-8k1k" model: path: "nvidia/MiniMax-M3-NVFP4" container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: "fp4" resources: gpu_type: "b200" - prefill_nodes: 4 + prefill_nodes: 2 prefill_workers: 4 - gpus_per_prefill: 2 + gpus_per_prefill: 4 decode_nodes: 2 decode_workers: 2 spread_workers: true @@ -70,7 +70,7 @@ backend: tensor-parallel-size: 1 pipeline-parallel-size: 1 enable-expert-parallel: true - data-parallel-size: 2 + data-parallel-size: 4 data-parallel-rpc-port: 13345 data-parallel-hybrid-lb: true max-model-len: 9472 diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 348b4c62ab..788f6ee6bf 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7405,11 +7405,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [1, 4, 8, 16] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep2-tp4-c1-c16-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml" decode: num-worker: 1 tp: 4 @@ -7418,11 +7418,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [64] prefill: num-worker: 1 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep2-tp4-c64-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml" decode: num-worker: 2 tp: 4 @@ -7431,11 +7431,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [128] prefill: num-worker: 2 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep2-tp4-c128-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml" decode: num-worker: 2 tp: 4 @@ -7444,11 +7444,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [256] prefill: num-worker: 3 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c256-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml" decode: num-worker: 2 tp: 4 @@ -7457,11 +7457,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [512] prefill: num-worker: 3 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep2-tp4-c512-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml" decode: num-worker: 2 tp: 4 @@ -7470,11 +7470,11 @@ minimaxm3-fp4-b200-dynamo-vllm: - conc-list: [1024] prefill: num-worker: 4 - tp: 2 - ep: 2 + tp: 4 + ep: 4 dp-attn: true additional-settings: - - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep2-tp4-c1024-8k1k.yaml" + - "CONFIG_FILE=recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml" decode: num-worker: 2 tp: 4 From f6ce556abb8f815cbbcbb26725b345391d1d2f3a Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 22:52:43 -0400 Subject: [PATCH 10/15] bump dynamo to 1.3.0.dev20260713 --- .../b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml | 2 +- .../minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml | 2 +- .../b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 2 +- .../b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 2 +- configs/nvidia-master.yaml | 8 ++++---- 13 files changed, 16 insertions(+), 16 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml index 17450bff62..cfb93de81a 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p1d-dep4-tp4-c1-c16-8k1k.yaml @@ -12,7 +12,7 @@ resources: decode_workers: 1 gpus_per_prefill: 4 gpus_per_decode: 4 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: {type: dynamo, enable_multiple_frontends: false} backend: type: vllm diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml index f5d85bb589..04ad968cc7 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/1p2d-dep4-tp4-c64-8k1k.yaml @@ -13,7 +13,7 @@ resources: spread_workers: true gpus_per_decode: 4 gpus_per_node: 8 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: type: dynamo enable_multiple_frontends: false diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml index 792bfb3d0b..eb990a3240 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/2p2d-dep4-tp4-c128-8k1k.yaml @@ -13,7 +13,7 @@ resources: spread_workers: true gpus_per_decode: 4 gpus_per_node: 8 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: type: dynamo enable_multiple_frontends: false diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml index a35ba5fd22..d7662e1b2e 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c256-8k1k.yaml @@ -13,7 +13,7 @@ resources: spread_workers: true gpus_per_decode: 4 gpus_per_node: 8 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: type: dynamo enable_multiple_frontends: false diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml index 7fb126691c..603bfb40ed 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/3p2d-dep4-tp4-c512-8k1k.yaml @@ -13,7 +13,7 @@ resources: spread_workers: true gpus_per_decode: 4 gpus_per_node: 8 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: type: dynamo enable_multiple_frontends: false diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml index 616259328d..8b6965818e 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/4p2d-dep4-tp4-c1024-8k1k.yaml @@ -13,7 +13,7 @@ resources: spread_workers: true gpus_per_decode: 4 gpus_per_node: 8 -dynamo: {install: true, version: 1.3.0.dev20260710} +dynamo: {install: true, version: 1.3.0.dev20260713} frontend: type: dynamo enable_multiple_frontends: false diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 4331d7e953..40bccc7773 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index 9f674442a1..9097d0a84e 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index ddf3247b5f..afa0bd9720 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index ec7b15d4ad..bc63f8683f 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index b8364cd66e..a729a86173 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 746fc98816..840d632ece 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -17,7 +17,7 @@ resources: dynamo: install: true - version: 1.3.0.dev20260710 + version: 1.3.0.dev20260713 frontend: type: dynamo diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 788f6ee6bf..d13db9eaee 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7393,7 +7393,7 @@ minimaxm3-fp4-b200-dynamo-vllm: runner: b200-multinode precision: fp4 framework: dynamo-vllm - router: { name: dynamo-router, version: "1.3.0.dev20260710" } + router: { name: dynamo-router, version: "1.3.0.dev20260713" } kv-p2p-transfer: nixl multinode: true disagg: true @@ -7488,7 +7488,7 @@ minimaxm3-fp4-b200-dynamo-vllm-mtp: runner: b200-multinode precision: fp4 framework: dynamo-vllm - router: { name: dynamo-router, version: "1.3.0.dev20260710" } + router: { name: dynamo-router, version: "1.3.0.dev20260713" } kv-p2p-transfer: nixl multinode: true disagg: true @@ -7871,7 +7871,7 @@ minimaxm3-fp4-b300-dynamo-vllm-mtp: runner: b300 precision: fp4 framework: dynamo-vllm - router: { name: dynamo-router, version: "1.3.0.dev20260710" } + router: { name: dynamo-router, version: "1.3.0.dev20260713" } kv-p2p-transfer: nixl multinode: true disagg: true @@ -7959,7 +7959,7 @@ minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4: runner: b300 precision: fp4 framework: dynamo-vllm - router: { name: dynamo-router, version: "1.3.0.dev20260710" } + router: { name: dynamo-router, version: "1.3.0.dev20260713" } kv-p2p-transfer: nixl multinode: true disagg: true From 4dadc9093fe958c1851f24b0bb5722c428f48090 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 23:19:57 -0400 Subject: [PATCH 11/15] remove allow_prefill_decode_colocation from B200 MTP recipes (OOM fix) --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 2 -- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 2 -- .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 2 -- .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 2 -- .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 2 -- .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 2 -- 6 files changed, 12 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 40bccc7773..3b1da0cfd7 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index 9097d0a84e..b454b606d5 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index afa0bd9720..fe93d3f5e8 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index bc63f8683f..cb056e9cf6 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index a729a86173..836528f4a5 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 840d632ece..0a1821588f 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -26,8 +26,6 @@ frontend: backend: type: vllm connector: null - allow_prefill_decode_colocation: true - allow_prefill_decode_colocation_across_nodes: true prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high From 41dee2b13d7bea4f7345bed7855530f396d6304f Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sat, 1 Aug 2026 23:41:29 -0400 Subject: [PATCH 12/15] add max-num-seqs: 256 to prefill to fix sampler warmup OOM --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 1 + 6 files changed, 6 insertions(+) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 3b1da0cfd7..9e0d1cce10 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index b454b606d5..0e2e2e553a 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index fe93d3f5e8..881ae9c556 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index cb056e9cf6..4e6ff5f8cb 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index 836528f4a5..b52d0c6f3c 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 0a1821588f..177fd6af31 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -57,6 +57,7 @@ backend: stream-interval: 32 max-cudagraph-capture-size: 2048 max-num-batched-tokens: 16384 + max-num-seqs: 256 decode: no-enable-flashinfer-autotune: true From 5cf507c82334126cf7316f7d8a6c49988c00b63f Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sun, 2 Aug 2026 00:49:11 -0400 Subject: [PATCH 13/15] enforce-eager on prefill to free CUDA graph memory --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 1 + .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 1 + 6 files changed, 6 insertions(+) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 9e0d1cce10..64bac901cc 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index 0e2e2e553a..e717117bda 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index 881ae9c556..c8cbd29c9d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index 4e6ff5f8cb..600c5dae87 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index b52d0c6f3c..9761ee3c2d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 177fd6af31..8bee219507 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -53,6 +53,7 @@ backend: gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true + enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 max-cudagraph-capture-size: 2048 From dd15e1e8db2d983b3af1f97e61521ae6cac68169 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sun, 2 Aug 2026 12:16:02 -0400 Subject: [PATCH 14/15] set decode max-num-seqs and max-cudagraph = conc/total_decode_gpus --- .../b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 6 +++--- .../b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 6 +++--- .../b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 6 +++--- .../b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 6 +++--- .../b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 6 +++--- .../b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 6 +++--- 6 files changed, 18 insertions(+), 18 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 64bac901cc..97c1dfb569 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 256 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 256 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 256 health_check: max_attempts: 360 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index e717117bda..41860e700d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 128 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 128 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 128 health_check: max_attempts: 360 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index c8cbd29c9d..6362704035 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 128 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 128 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 128 health_check: max_attempts: 360 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index 600c5dae87..821fee9d53 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 64 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 64 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 64 health_check: max_attempts: 360 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index 9761ee3c2d..f1d621e1f3 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 64 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 64 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 64 health_check: max_attempts: 360 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 8bee219507..45b9fb2878 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,7 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 32 max-num-batched-tokens: 16384 max-num-seqs: 256 @@ -75,9 +75,9 @@ backend: language-model-only: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-num-seqs: 1024 + max-num-seqs: 32 max-num-batched-tokens: 16384 - max-cudagraph-capture-size: 2048 + max-cudagraph-capture-size: 32 health_check: max_attempts: 360 From b5ccd41227dafc9896b5f527beaeb5a0b6462c94 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Sun, 2 Aug 2026 13:58:03 -0400 Subject: [PATCH 15/15] remove max-cudagraph-capture-size from prefill (using enforce-eager) --- .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml | 1 - .../minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml | 1 - .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml | 1 - .../minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml | 1 - .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml | 1 - .../minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml | 1 - 6 files changed, 6 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml index 97c1dfb569..44ae8cdc3d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 256 max-num-batched-tokens: 16384 max-num-seqs: 256 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml index 41860e700d..a99f24daba 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p1d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 128 max-num-batched-tokens: 16384 max-num-seqs: 256 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml index 6362704035..4118e0b805 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 128 max-num-batched-tokens: 16384 max-num-seqs: 256 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml index 821fee9d53..61be00084c 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p2d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 64 max-num-batched-tokens: 16384 max-num-seqs: 256 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml index f1d621e1f3..4b8cf224f5 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp4-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 64 max-num-batched-tokens: 16384 max-num-seqs: 256 diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml index 45b9fb2878..3351cfb9bf 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b200-fp4/8k1k/mtp/1p4d-dep4-tp8-eagle3-8k1k.yaml @@ -56,7 +56,6 @@ backend: enforce-eager: true speculative-config: '{"method":"eagle3","model":"Inferact/MiniMax-M3-EAGLE3-GQA","num_speculative_tokens":3,"attention_backend":"FLASH_ATTN"}' stream-interval: 32 - max-cudagraph-capture-size: 32 max-num-batched-tokens: 16384 max-num-seqs: 256