ComfyUI 本地 AI 绘画工作流:从安装到出图的全新手册

导读:为什么你需要 ComfyUI? 如果你用过 Stable Diffusion 的 WebUI(也就是大名鼎鼎的 AUTOMATIC 那个界面),你会习惯「输入一段文字 → 点生成 → 等图片出来」的流程——简单粗暴,但可定制性有限。ComfyUI 走的是另一条路:它把整个绘图过程拆成一个个「节点」(Node),你用鼠标把这些节点连起来,像搭积木一样定义每一步要做什么。 这种设计的优势是灵活度极高——你想用两个不同的模型接力?想在采样中途插一个超分节点?能在 WebUI 里折腾半天甚至写插件的事,在 ComfyUI 里就是多拖几个节点、连几条线。 本文将带你走完一遍:安装 ComfyUI → 理解模型目录结构 → 掌握最小文生图工作流 → 导入模板开始创作。全程不需要写代码,适合有基本电脑操作能力的零基础用户。 ⚠️ 硬件要求:ComfyUI 的核心是稳定扩散(Stable Diffusion)模型推理,需要一块 NVIDIA 独立显卡(显存建议 ≥4GB)。苹果 M 系列芯片也可运行,Windows 用户在 WSL2 中体验最佳。显卡配置不够?文末会提到云端替代方案。 一、ComfyUI 是什么:节点式 AI 绘图工具 先给概念做个翻译: 术语 白话解释 节点(Node) 一个小功能模块,比如"加载模型"“编码提示词"“采样去噪”。每个节点有输入端口和输出端口。 工作流(Workflow) 把所有节点按逻辑连起来形成的流水线,决定了"数据从哪来→经过哪些处理→最终产出什么”。 潜空间(Latent Space) 图片在神经网络里的压缩表示,比原始像素小很多,模型在潜空间上做修改效率远高于直接改像素。 采样器(Sampler) 把随机噪声一步步变成清晰图片的算法,常见有 Euler、DPM++、Euler a 等。 对比一下和传统 WebUI 的差异: WebUI (AUTOMATIC):提供固定表单,你填提示词、选参数、点按钮。所有内部步骤被封装好,你看不见也改不了底层链路。 ComfyUI:每个步骤都是一个可见的节点。你能看到数据流向的每一环,任意替换或插入新节点。 简单来说:WebUI 像是餐厅点餐套餐,ComfyUI 像是自助厨房——你能自己决定每道菜怎么做。 上图:最简文生图的 5 步核心链路。每个方框是一个节点,箭头是数据流向。点击正文末尾导出的 .json 文件即可在工作流管理器中一键导入。 ...

2026-08-26 · 9 min · AIGestalt

Whisper 本地语音转文字:从零搭建开源 ASR 转写环境

导读 如果你有一段录音(会议、播客、课堂笔记),想快速把它变成文字稿——以前你可能要花钱买在线转写服务,或者花好几天搭一套复杂的深度学习系统。今天我们要用的 Whisper 正好解决了这个问题:它是 OpenAI 在 2022 年开源的多语言语音识别模型,可以在你自己的电脑上离线运行,免费、隐私有保障,支持中文在内的 99 种语言。 本篇从零开始,帮你把整个环境搭起来。只需要一个前置依赖 ffmpeg,剩下的通过 pip 一行命令搞定。文末提供一键脚本,Windows / macOS / Linux 都能跑。 一、Whisper 是什么? Whisper 是 OpenAI 发布的一个自动语音识别(ASR,Automatic Speech Recognition)模型。它用来自 68 万小时多语言+多标签数据的训练数据训练的,核心特点包括: 开源免费:Apache 2.0 许可,可以随意修改和商业使用 多语言:支持中文、英文、日语等 99 种语言的识别和翻译 本地运行:不需要联网调用 API,装好就在本机跑,保护隐私 开箱即用:命令行工具 + Python API 双接口,小白也能上手 GitHub 仓库地址:https://github.com/openai/whisper (国内用户访问不畅时,可以加 ghfast.top 前缀代理:https://ghfast.top/https://github.com/openai/whisper) 模型规格一览 Whisper 提供了多个规格(规格越大,准确率越高,但需要的内存和速度越慢)。官方共有以下模型供选择: 模型 参数量 VRAM 需求 参考速度 适用场景 tiny 39M ~1 GB 最快 快速原型验证 base 74M ~1 GB 快 日常轻度使用 small 244M ~2 GB 中等 较好中文效果 medium 769M ~5 GB 较慢 高准确率要求 large-v1/v2/v3 1.5B ~10 GB 很慢 最高精度 distil-small/en / distil-medium/en 量化蒸馏版 — 比原版快 2~6 倍 英文加速(非官方完整版) 推荐起步策略:先用 tiny 或 base 确认流程畅通,再按需换 small 或更大的模型。 ...

2026-08-26 · 10 min · AIGestalt

Ollama 本地部署大模型:零基础把 AI 跑在自己的电脑上(2026 完整教程)

📌 新手提示:本文结尾提供了一键部署脚本(Windows / macOS / Linux 通用),自动安装 Ollama 并引导你运行第一个模型,不想手动操作的同学直接拉到文末运行。 前言 这几年"大模型"(能对话、能写代码的人工智能模型,像 ChatGPT、DeepSeek 背后的大脑)都是云端服务——你的问题发到别人服务器上,算完再传回来。好处是效果强,坏处是你得注册、充值、排队,还有隐私顾虑:所有对话都经过第三方。 Ollama 是另一条路:它把开源大模型装到你自己的电脑上,本地运行,不联网、不花钱、数据不出门。它的定位可以这么理解: 云端模型像"点外卖",本地模型像"自己家做饭"——外卖(云端)省事但付钱、排队;做饭(本地)要一次投入食材和设备(下载模型、占内存),但之后无限吃、私密、断网也能吃。 本教程面向零基础读者,走完五步: 明白 Ollama 是什么 在自己的电脑上装好它 跑起人生第一个本地大模型 学会用代码调用它(本地 API) 弄清"本地 vs 云端"怎么选 官方文档:https://docs.ollama.com/;模型库列表:https://ollama.com/search。 一、Ollama 是什么 一句话:Ollama 是一个"大模型运行工具"——装好后,你在命令行输入一条命令,它就从官方模型库下载一个开源模型到本地(几 GB 到几十 GB),然后在你的电脑上把它跑起来,你就能像和 ChatGPT 聊天一样和它对话。 几个关键事实: 开源免费:Ollama 本身是开源项目,模型也大多是开源模型(如 Qwen、DeepSeek、Llama、Gemma、GPT-OSS 等系列) 离线可用:模型下载完成后完全本地运行,不需要网络(断网也能聊) 有 API:暴露一个本地接口(默认端口 11434),你可以用普通 HTTP 请求或 OpenAI 兼容的 SDK 调用它——也就是说,你在云端 API 写过的调用代码,改一行地址就能指向本地模型 跨平台:macOS / Windows / Linux / WSL2 / Docker 都支持 二、安装 Ollama(三平台) 打开终端(macOS"终端"、Linux"终端"、Windows 建议 WSL,即 Windows 自带的 Linux 子系统),按你的系统执行一行命令: ...

2026-08-25 · 6 min · AIGestalt