Ollama 本地部署大模型:零基础把 AI 跑在自己的电脑上(2026 完整教程)

📌 新手提示:本文结尾提供了一键部署脚本(Windows / macOS / Linux 通用),自动安装 Ollama 并引导你运行第一个模型,不想手动操作的同学直接拉到文末运行。 前言 这几年"大模型"(能对话、能写代码的人工智能模型,像 ChatGPT、DeepSeek 背后的大脑)都是云端服务——你的问题发到别人服务器上,算完再传回来。好处是效果强,坏处是你得注册、充值、排队,还有隐私顾虑:所有对话都经过第三方。 Ollama 是另一条路:它把开源大模型装到你自己的电脑上,本地运行,不联网、不花钱、数据不出门。它的定位可以这么理解: 云端模型像"点外卖",本地模型像"自己家做饭"——外卖(云端)省事但付钱、排队;做饭(本地)要一次投入食材和设备(下载模型、占内存),但之后无限吃、私密、断网也能吃。 本教程面向零基础读者,走完五步: 明白 Ollama 是什么 在自己的电脑上装好它 跑起人生第一个本地大模型 学会用代码调用它(本地 API) 弄清"本地 vs 云端"怎么选 官方文档:https://docs.ollama.com/;模型库列表:https://ollama.com/search。 一、Ollama 是什么 一句话:Ollama 是一个"大模型运行工具"——装好后,你在命令行输入一条命令,它就从官方模型库下载一个开源模型到本地(几 GB 到几十 GB),然后在你的电脑上把它跑起来,你就能像和 ChatGPT 聊天一样和它对话。 几个关键事实: 开源免费:Ollama 本身是开源项目,模型也大多是开源模型(如 Qwen、DeepSeek、Llama、Gemma、GPT-OSS 等系列) 离线可用:模型下载完成后完全本地运行,不需要网络(断网也能聊) 有 API:暴露一个本地接口(默认端口 11434),你可以用普通 HTTP 请求或 OpenAI 兼容的 SDK 调用它——也就是说,你在云端 API 写过的调用代码,改一行地址就能指向本地模型 跨平台:macOS / Windows / Linux / WSL2 / Docker 都支持 二、安装 Ollama(三平台) 打开终端(macOS"终端"、Linux"终端"、Windows 建议 WSL,即 Windows 自带的 Linux 子系统),按你的系统执行一行命令: ...

2026-08-25 · 6 min · AIGestalt

vLLM 生产级部署实战:一条命令把开源大模型变成 OpenAI 兼容 API 服务

📌 新手提示:本文定位"进阶一档"——目标读者是已会调 API、想把自己的开源模型部署成服务的学生与开发者。命令全部可直接复制;文末脚本自动装环境、下载模型、启动服务。 前言 上一篇 Ollama 教程解决了"把 AI 跑在个人电脑上"——但真实的生产环境(网站、公司服务)用的是另一类工具,其中的公认主力是 vLLM(GitHub 4 万+ 星,UC Berkeley 发起)。 一句话理解 vLLM: Ollama 是单机玩具,vLLM 是生产引擎。它把开源大模型(Qwen、DeepSeek、Llama…)变成高性能 API 服务——吞吐量比朴素推理高一个数量级,同时把显存利用压榨到极致(官方特性:PagedAttention 连续批处理、KV 缓存复用)。 用官网定位:“Easy, fast, and cheap LLM serving for everyone”(人人可用的又好又快又省的大模型服务)。 本文基于官方快速开始(https://docs.vllm.ai,海外站点国内访问需科学上网)编写,走完四步:装 vLLM → 离线批量推理 → 一条命令起 OpenAI 兼容服务 → 用任意代码调用它。 一、安装(两条命令) vLLM 是 Python 包,官方推荐用 uv 建干净环境(uv 是新一代 Python 工具): uv venv --python 3.12 --seed source .venv/bin/activate uv pip install vllm --torch-backend=auto 你没装 uv?curl -LsSf https://astral.sh/uv/install.sh | sh 一行装(官方方式)。不想用 uv,pip install vllm 也行,但官方把 uv 列为推荐——因为它快且环境干净。 ...

2026-08-25 · 7 min · AIGestalt