vLLM 生产级部署实战:一条命令把开源大模型变成 OpenAI 兼容 API 服务
📌 新手提示:本文定位"进阶一档"——目标读者是已会调 API、想把自己的开源模型部署成服务的学生与开发者。命令全部可直接复制;文末脚本自动装环境、下载模型、启动服务。 前言 上一篇 Ollama 教程解决了"把 AI 跑在个人电脑上"——但真实的生产环境(网站、公司服务)用的是另一类工具,其中的公认主力是 vLLM(GitHub 4 万+ 星,UC Berkeley 发起)。 一句话理解 vLLM: Ollama 是单机玩具,vLLM 是生产引擎。它把开源大模型(Qwen、DeepSeek、Llama…)变成高性能 API 服务——吞吐量比朴素推理高一个数量级,同时把显存利用压榨到极致(官方特性:PagedAttention 连续批处理、KV 缓存复用)。 用官网定位:“Easy, fast, and cheap LLM serving for everyone”(人人可用的又好又快又省的大模型服务)。 本文基于官方快速开始(https://docs.vllm.ai,海外站点国内访问需科学上网)编写,走完四步:装 vLLM → 离线批量推理 → 一条命令起 OpenAI 兼容服务 → 用任意代码调用它。 一、安装(两条命令) vLLM 是 Python 包,官方推荐用 uv 建干净环境(uv 是新一代 Python 工具): uv venv --python 3.12 --seed source .venv/bin/activate uv pip install vllm --torch-backend=auto 你没装 uv?curl -LsSf https://astral.sh/uv/install.sh | sh 一行装(官方方式)。不想用 uv,pip install vllm 也行,但官方把 uv 列为推荐——因为它快且环境干净。 ...