10分钟跑通大模型推理性能测试:vLLM 吞吐量压测脚本完整指南

10分钟跑通大模型推理性能测试:vLLM 吞吐量压测脚本完整指南 10分钟跑通大模型推理性能测试vLLM 吞吐量压测脚本完整指南【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm部署开源大模型时你最先卡住的问题往往是这台机器到底跑这个模型有多快选 vLLM 还是原生 Transformers差距有多少本文带你用vLLM 吞吐量压测benchmark_throughput官方自带基准测试脚本十分钟拿到 requests/s、tokens/s 指标让感觉挺快变成可对比的数字。关键指标速览 吞吐量Throughput单位时间内模型处理的数据总量分请求数和 token 数两种口径requests/s每秒完成多少条提示词请求衡量服务能扛多少并发tokens/s每秒处理多少 token含输入输出衡量计算总效率输入/输出长度压测时人为固定的 prompt 长度和生成长度决定单次请求的负载对比基线同一脚本支持vllm、hfHuggingFace Transformers两个后端同一台机器跑两次即可量化加速比图不同大模型在各类基准测试上的表现对比吞吐测试解决的是跑得多快这类榜单解决答得多好从零跑通第一次测试环境准备你只需要一台有 NVIDIA GPU 的机器仓库示例中 7B 模型用 RTX 3090 即可装好 vLLMpip install vllm git clone https://gitcode.com/GitHub_Trending/se/self-llm cd self-llm压测脚本已放在仓库的 models/Qwen2/benchmark_throughput.py把它拷到你的模型目录旁边即可。执行测试以 Qwen2-7B-Instruct 为例一条命令跑起 vLLM 后端压测python benchmark_throughput.py \ --model /root/autodl-tmp/qwen/Qwen2-7B-Instruct \ --backend vllm \ --input-len 64 \ --output-len 128 \ --num-prompts 25 \ --max-model-len 512关键参数说明--model模型本地路径--input-len/--output-len固定每条请求的输入和输出长度--num-prompts测试样本数首次跑用 25 足够图压测前先在镜像/框架层面确认 PyTorch 与 CUDA 版本匹配想量化加速比把--backend vllm改成--backend hf并加上--hf-max-batch-size 25再跑一次即可。仓库里 Qwen2 的 vLLM 部署教程 有完整对照流程。看懂输出结果脚本跑完会打印一行核心结果Throughput: 7.68 requests/s, 1474.75 tokens/s新版 vLLM 的脚本会输出三个值各字段含义对照如下指标含义健康参考值requests/s每秒完成的请求数7B 模型消费级显卡上5~30长度越短越高total tokens/s输入输出 token 总吞吐同硬件 7B 模型约 1000~6000随长度翻倍变化output tokens/s模型净生成速度通常约为 total 的 1/1.5~1/2 区间仓库实测数据同一块卡上 Qwen2-7B 走 vLLM 是 7.68 requests/s走 hf 后端只有 5.73 requests/svLLM 快约 34%DeepSeek-R1-Distill-Qwen-7B 短文本场景甚至跑到 29.34 requests/s。判断你的结果是否合理看同后端、同长度下的量级即可。踩坑与排障 显存不够OOM应对先降--num-prompts再调小--input-len/--output-lenvLLM 默认占 90% 显存可用--gpu-memory-utilization 0.8留出余量。两次结果波动很大应对固定--seed把--num-prompts加到 50 以上跑之前nvidia-smi确认没有别的进程占着 GPU。hf 后端直接报错应对--hf-max-batch-size只对 hf 后端生效但必填漏了脚本会直接抛错反之 vllm 后端传了它也会报错别混着抄命令。图显存紧张时换一张大显存的卡是比降并发更直接的解法收个尾一条benchmark_throughput.py命令就能拿到 requests/s 与 tokens/s无需自己写压测代码同机器、同长度下对比vllm和hf两个后端加速比一目了然指标要固定长度、固定 seed、固定样本数才可比别拿不同配置的数硬比7B 模型单卡即可压测先跑短文本64/128定位瓶颈再测长文本现在就选一个你部署过的模型把上面的命令填上路径跑一遍明天对比推理引擎时你就有数据说话了。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考