测了几轮,目前效果比较好的参数为:
- FP8 量化, max throughput ~= 600 tps
vllm serve ./Qwen3.8-27B-FP8 \
--host 0.0.0.0 --port 8000 \
--served-model-name qwen3.8-27b \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.95 \
--max-model-len 131072 \
--max-num-batched-tokens 8192 \
--max-num-seqs 32 \
--async-scheduling \
--kv-cache-dtype fp8 \
--enable-prefix-caching \
--enable-chunked-prefill \
--enable-prompt-tokens-details \
--default-chat-template-kwargs '{"reasoning_effort":"medium"}' \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--kv-offloading-backend native \
--kv-offloading-size 200 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_code- 原版, throughput ~= 200 tps
vllm serve ./Qwen3.8-27B \
--host 0.0.0.0 --port 8000 \
--served-model-name qwen3.8-27b \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.95 \
--max-model-len 131072 \
--max-num-batched-tokens 8192 \
--max-num-seqs 4 \
--async-scheduling \
--enable-prefix-caching \
--enable-chunked-prefill \
--enable-prompt-tokens-details \
--default-chat-template-kwargs '{"reasoning_effort":"medium"}' \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--kv-offloading-backend native \
--kv-offloading-size 200 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder