如果你不是电脑专家,怎样才能在自己的电脑上运行人工智能?我专门为想了解本地 AI 的初学者准备了这篇教程:不需要命令行,不需要配置服务器,也不需要一台昂贵的高性能电脑。 只需点击几次,我们就会在 Windows 上安装 Ollama,下载一个小型模型,并开始第一次完全在 本机运行的对话。

11 个步骤 安装并运行你的第一个本地 AI
约 3.4 GB 推荐使用的 Qwen 3.5 4B 模型大小
免费 Ollama 和本文介绍的模型都可以免费下载
本地运行 回答由你自己的电脑完成计算

本地 AI 的性能通常无法达到 ChatGPT、Claude 或 Mistral Le Chat 等顶级云端服务的水平。 但它仍然非常适合改写邮件、纠正文字、总结文档、解释概念、讨论哲学,或者帮助你分析日常问题。

最令人兴奋的是,你会发现一台普通电脑已经能够运行这类系统。我们的目标不是取代大型云端平台, 而是亲自理解:今天在家里已经可以做到什么。

01 什么是本地 AI?

Qwen、Llama、Gemma 或 Ministral 等人工智能系统都依赖一个“模型”。模型是一个文件, 其中保存了训练过程中学习到的参数。通常,这类模型运行在大型公司的数据中心里, 你输入的文字会离开自己的电脑,并在远程服务器上处理。

使用 Ollama 时,模型会被下载到你的硬盘,然后加载到电脑内存中。处理器以及兼容的显卡 会在本机完成生成回答所需的计算。

02 开始前需要检查什么

较新的 Windows 版本

Ollama 需要 Windows 10 22H2 或更新版本,也可以使用 Windows 11。

足够的可用内存

请关闭游戏、视频编辑软件以及不必要的浏览器窗口。Qwen 3.5 4B 在 16 GB 内存的电脑上 使用起来更舒服,但更小的模型也可以在较少内存上运行。

足够的硬盘空间

Ollama 应用本身需要数 GB 空间,每个下载的模型也会占用额外空间。 建议在开始本教程前至少保留 10 GB 可用空间。

互联网连接

网络用于下载应用和模型。本教程使用的 Qwen 3.5 4B 文件大小约为 3.4 GB。

较新的显卡可以明显提高生成速度,但并不是必须的。当显卡不受支持时,Ollama 也可以使用处理器。 NVIDIA 和部分 AMD 显卡可以直接加速,其他显卡是否能通过 Vulkan 加速则取决于硬件和驱动。

03 在 Windows 上安装 Ollama

1 打开 Ollama 官方网站

打开浏览器并访问 ollama.com , 然后点击 Download 按钮。

Ollama 官网首页和 Download 下载按钮
请始终从 Ollama 官方网站下载安装程序。

2 下载 Windows 版本

在下载页面选择 Windows,然后点击深色背景上的下载按钮。

Ollama 下载页面中选中的 Windows 版本
Ollama 同时支持 macOS 和 Linux。

3 打开下载好的文件

打开 Windows 的“下载”文件夹,然后双击 OllamaSetup.exe

Windows 下载文件夹中的 OllamaSetup.exe 文件
官方安装程序的文件名是 OllamaSetup.exe。

4 开始安装

安装窗口出现后,点击 Install。Ollama 的标准安装通常会在当前 Windows 用户账户中完成,一般不需要管理员权限。

带有 Install 按钮的 Ollama 安装窗口
点击一个按钮即可开始标准安装。

5 等待安装完成

请耐心等待安装程序完成操作。根据电脑性能和网络状况,这一步可能需要几分钟。

Ollama 安装进度界面
安装过程中请不要关闭窗口。

6 创建新的对话

安装完成后,如果 Ollama 没有自动打开,请从 Windows 开始菜单启动它, 然后点击 New Chat

Ollama 主界面中的 New Chat 按钮
Ollama 图形界面让你无需使用终端即可聊天。

7 打开模型列表

点击窗口左下角的模型选择器。你可以在这里下载并测试不同的人工智能模型。

Ollama 左下角的模型选择器
你可以随时从这个菜单切换当前使用的模型。

8 搜索 Qwen 3.5 4B

在搜索框中准确输入 qwen3.5:4b,然后点击模型右侧的下载图标。

请确认模型名称中没有 :cloud。本文使用的版本大小约为 3.4 GB, 下载后会在本地运行。

Ollama 中搜索 qwen3.5:4b 并显示下载按钮
Qwen 3.5 4B 非常适合作为普通电脑上的第一个本地模型。

04 发送第一条消息

9 等待模型下载完成

第一次使用最慢,因为需要下载完整模型。文件保存到电脑后,下次不需要重新下载。

10 输入你的第一个问题

在对话输入框中输入,例如: 请用简单的语言解释什么是本地人工智能。

然后点击向上的箭头发送消息。

Ollama 的消息输入框和发送按钮
你可以像使用普通聊天软件一样自然地输入问题。

11 等待回答生成

电脑正在计算回答。如果模型主要使用处理器运行,第一批文字可能需要等待几秒钟才会出现。

当回答显示出来时,你就成功了:一个人工智能模型已经直接运行在你的电脑上。

Qwen 3.5 4B 在 Ollama 中生成的第一条本地回答
恭喜:模型正在使用你自己的电脑资源生成回答。

05 我推荐的小型模型

如果想测试其他模型,只需回到第 7 步,搜索模型名称,下载并在对话中选择它。

要搜索的模型 Ollama 显示的大小 适合的电脑 主要优点
qwen3.5:0.8b 约 1 GB 较老或内存较少的电脑 速度非常快,适合确认安装是否正常。
llama3.2:1b 约 1.3 GB 入门级电脑和配置较低的笔记本 适合简单改写、短摘要和轻量聊天。
llama3.2:3b 约 2 GB 普通家用电脑 较均衡的多语言模型,适合改写和总结。
phi4-mini 约 2.5 GB 较新但资源有限的电脑 擅长推理、逻辑、数学和遵循指令。
ministral-3:3b 约 3 GB 中端电脑,建议配备 16 GB 内存 多语言支持良好,支持图像,并针对本地设备优化。
qwen3.5:4b 约 3.4 GB 较新的电脑,建议配备 16 GB 内存 适合聊天、推理、图像和工具调用的通用选择。

表中的大小是 Ollama 模型库显示的量化文件大小。实际聊天时占用的内存可能更多。 如果模型太慢,请直接选择更小的模型。

06 为什么电脑会变热或回答较慢

生成回答的过程叫作推理。模型需要进行大量计算来选择每一个词。 兼容的显卡可以加快这个过程,但 Ollama 也可以使用处理器运行。

  • 使用处理器生成回答通常会更慢。
  • 小模型通常比大模型回答更快。
  • 对话越长,占用的内存越多。
  • 关闭其他应用可以释放内存。
  • 笔记本连接电源后,可以避免电池模式下的性能限制。
  • 高负载时风扇加速是正常现象。

“上下文”表示模型能够记住多少对话内容。Ollama 应用允许增加上下文长度, 但这会显著提高内存占用。第一次体验时,保留默认设置即可。

07 测试本地 AI 的几个简单方法

改写邮件

让它纠正错误、把语气变得更专业,或者缩短消息。

理解一个主题

让它使用简单的语言和例子解释某个概念。

总结文字

粘贴一段长度适中的文字,让它提取五个最重要的信息点。

分析一个问题

描述你的情况,让它给出多个选择,并列出各自的优点和缺点。

下面是几条可以直接复制的提示词:

  • “请纠正这封邮件,但不要改变我的语气:……”
  • “请像对 12 岁孩子一样解释互联网和 Web 的区别。”
  • “请把这段文字总结成五个要点:……”
  • “请用鸡蛋、西红柿和米饭给我三个做饭建议。”
  • “请扮演哲学老师,向我解释斯多葛主义。”
  • “请帮我准备下一次预约时需要提出的问题清单。”

08 必须了解的限制

  • 模型不一定了解最近发生的事情。
  • 如果没有启用联网功能,它无法访问互联网。
  • 小模型在复杂任务中可能会丢失上下文。
  • 它不能替代医生、律师、会计师或其他专业人士。
  • 它可能重复训练数据中的错误或偏见。
  • 本地隐私并不能防止能够访问你电脑的人看到数据。

对于医疗、法律、金融决策,或任何可能让人处于危险中的情况, 请只把 AI 当作准备问题的工具,之后仍应咨询合格的专业人士。

09 遇到问题时怎么办

下载时间非常长

检查互联网连接并耐心等待。模型可能需要下载数 GB 数据。 不要重复启动同一个下载任务。

AI 回答非常慢

关闭其他应用,然后尝试 llama3.2:1bqwen3.5:0.8b

Ollama 无法打开

重启 Windows,然后从开始菜单中搜索 Ollama。 同时确认安装过程已经完成。

硬盘快满了

在应用中删除不用的模型。Ollama 会把 Windows 模型保存在你的用户账户目录中。

电脑温度过高

检查散热孔,使用坚硬表面,选择更小的模型。 如果出现异常现象,请立即停止测试。

模型使用了其他语言回答

在消息开头写: “请只使用简体中文回答,并使用简单句子。”

S 官方资料