测了几轮,目前效果比较好的参数为:

  1. FP8 量化, max throughput ~= 600 tps
vllm serve ./Qwen3.8-27B-FP8 \
  --host 0.0.0.0 --port 8000 \
  --served-model-name qwen3.8-27b \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.95 \
  --max-model-len 131072 \
  --max-num-batched-tokens 8192 \
  --max-num-seqs 32 \
  --async-scheduling \
  --kv-cache-dtype fp8 \
  --enable-prefix-caching \
  --enable-chunked-prefill \
  --enable-prompt-tokens-details \
  --default-chat-template-kwargs '{"reasoning_effort":"medium"}' \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
  --kv-offloading-backend native \
  --kv-offloading-size 200 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_code
  1. 原版, throughput ~= 200 tps
vllm serve ./Qwen3.8-27B \
  --host 0.0.0.0 --port 8000 \
  --served-model-name qwen3.8-27b \
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.95 \
  --max-model-len 131072 \
  --max-num-batched-tokens 8192 \
  --max-num-seqs 4 \
  --async-scheduling \
  --enable-prefix-caching \
  --enable-chunked-prefill \
  --enable-prompt-tokens-details \
  --default-chat-template-kwargs '{"reasoning_effort":"medium"}' \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
  --kv-offloading-backend native \
  --kv-offloading-size 200 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder
Last modification:August 21, 2026
如果觉得我的文章对你有用,请随意赞赏