← 返回全部文章

本地免费跑 Claude Code:Ollama 设置指南

用 Ollama 的 Anthropic Messages API 支持,把 Claude Code 指向本地开源模型。保留同一个 CLI、文件编辑、工具调用和 CLAUDE.md 工作流。

大多数编程工具还没让你敲第一行,就先要信用卡。

现在可以直接在笔记本上跑真正的 Claude Code CLI:不用 API key,不用付费计划,首次下载后离线也能用。文件编辑、工具调用、CLAUDE.md 支持都保留,变化只有一个:模型大脑在你的机器上运行。

2026 年 1 月,Ollama 加入了对 Anthropic Messages API 的原生支持。也就是说,Claude Code 可以直接和笔记本上的任意本地模型通信。不需要代理,不需要奇技淫巧,是官方支持的路径。

你可以用 0 成本拿到 Claude Opus 约 80% 到 90% 的日常编码质量。

下面是从零开始的完整设置。大约 10 分钟,5 步结束。

Phase 0:先换个计费视角

AI 工具的账单,本质上来自另一端的模型。

Anthropic 希望你订 Claude Max,每月 100 到 200 美元。重度 API 用户每月会花 60 到 200 美元 token 费。每次读文件、每次工具调用都在计费。

Ollama 的 Anthropic API 支持改变了这件事。 Claude Code 仍然是 Anthropic 官方 CLI,但它可以指向免费的本地模型。

一年的 Claude Max 最高 2400 美元。本地栈的月费是 0 。你继续使用同一个工具,只是把模型换到本地。

export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_AUTH_TOKEN="***"
export ANTHROPIC_API_KEY=***

Phase 1:需要的三样东西

只需要三部分。

第一,Ollama 。它负责在笔记本上运行模型。需要 0.14 或更高版本,这个版本开始支持 Claude Code 。

第二,Claude Code 。 Anthropic 官方 CLI,用 npm 安装一次。外观和使用方式都保持一致。

第三,一个免费的代码模型。 2026 年可以优先看这几个:

Qwen 3 Coder 30B:综合最好,建议 32GB RAM 以上。
Qwen 3 Coder 14B:甜点位,16GB 机器可跑。
GLM 4.7 Flash:128K 上下文,工具调用不错,16GB 可跑。
DeepSeek Coder V2:面向代码训练,隐私场景合适,16GB 可跑。
Gemma 4 12B:轻、快,8GB 机器可跑。

不确定选哪个,就先选 Qwen 3 Coder 14B。大多数机器都能跑。

Phase 2:10 分钟设置

打开终端,按顺序执行。

Step 1:安装 Ollama

Mac 可以直接从 ollama.com 下载应用。 Windows 下载对应安装器。

检查版本:

ollama --version

需要 0.14 或更高版本。如果版本太旧,重新运行安装命令更新。

Step 2:拉取模型

ollama pull qwen3-coder:14b

这一步大约会下载 10GB 。下载完成后,后续可以离线使用。

Step 3:安装 Claude Code

npm install -g @anthropic-ai/claude-code

检查安装:

claude --version

Step 4:把 Claude Code 指向本地模型

设置三个环境变量:

export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_AUTH_TOKEN=**"*"
export ANTHROPIC_API_KEY=***

然后用本地模型运行 Claude Code:

claude --model qwen3-coder:14b

Claude Code 会照常打开,只是模型已经切到你的笔记本。

如果希望每次终端都自动生效,把这几行写进 shell 配置:

echo 'export ANTHROPIC_BASE_URL="http://localhost:11434"' >> ~/.zshrc
echo 'export ANTHROPIC_AUTH_TOKEN=**"*"' >> ~/.zshrc
echo 'export ANTHROPIC_API_KEY=***' >> ~/.zshrc
source ~/.zshrc

如果你用 bash,把 .zshrc 换成 .bashrc

Step 5:测试

进入任意项目目录:

cd ~/your-project
claude --model qwen3-coder:14b

然后让它做几件小事:

Read the README and tell me what this project does.
Find all TODO comments in this codebase.
Write a unit test for the main function.
Create a new file called hello.py with a small Flask app.

如果它能读文件、写代码、运行命令,配置就完成了。

Phase 3:按硬件选模型

你的笔记本决定该跑哪个模型。不要硬上。

8GB RAM:跑 Gemma 4 12B 的 q4 量化版本。速度快,能力有限,适合小改动。

16GB RAM:跑 Qwen 3 Coder 14B 或 GLM 4.7 Flash。大多数人最合适的选择,可以做真实编码工作。

32GB RAM:M2 Pro、M3 Pro、M4 Pro 这类机器,可以跑 Qwen 3 Coder 30B。本地质量更高,长会话更稳。

64GB 或更多:M3 Max、M4 Max、工作站,可以跑更大的模型,接近云端质量。

NVIDIA 24GB VRAM:同样的模型会快很多,3090 或 4090 是理想配置。

如果机器慢,试试量化模型:

ollama pull qwen3-coder:14b-q4_K_M

量化模型会牺牲一点质量,换来明显速度提升。多数日常任务很难感知差别。

Phase 4:每天最适合交给本地 Claude 的 5 类工作

本地模型在这些任务上很划算。

1. 代码库问答

进入一个新 repo,不知道哪里负责什么。直接在目录里打开 Claude Code,用自然语言问:登录逻辑在哪里?这个函数做什么?为什么这个文件这么大?

本地模型擅长读、解释、帮你建立地图。熟悉代码库的时间可以从一周压到一小时,成本为 0 。

2. 多文件重构

让它跨多个文件做干净的 rename 或 extract 。 Claude Code 会批量编辑。配合 Git,如果改坏了,一个 git reset 就能回退。

过去会吃掉几小时的机械活,现在几分钟完成。

3. 写测试

指向一个文件,让它为所有 public function 写单元测试。写完后运行测试,再修失败项。

这是本地模型最适合的任务之一。测试写作重复、无聊、量大,正适合无限免费模型。

4. 过夜任务

长任务、大测试套件、枯燥数据处理,都可以写成一次性 prompt,回车后睡觉,醒来再看结果。

Claude Max 有额度限制,本地模型没有。

5. 敏感代码

客户项目、专利、内部工具、 NDA 文件,不适合上传到云端模型。本地运行时,代码留在机器上,默认隐私更好。

Phase 5:混合工作流

更稳的做法通常是本地和云端一起用。

本地免费模型处理 80%:读代码、写测试、小改动、 bug fix 、文档、代码 review 。这些构成一天里的大部分工作。

云端 Claude 处理 20%:大架构决策、大范围重构、前沿推理、非常难的 bug 。

切换只需要一个命令。本地 Claude:

claude --model qwen3-coder:14b

需要云端 Claude 时,在新终端取消本地变量:

unset ANTHROPIC_BASE_URL
unset ANTHROPIC_AUTH_TOKEN
claude

这样就回到 Anthropic 服务器,使用完整 Opus 能力。

两个终端,两套模型,同一个 CLI 。

这套混合方式可以把重度用户每月约 200 美元的开销降到约 20 美元。关键任务上保留云端质量,日常任务交给本地。

Phase 6:本地胜过云端的场景

有几类任务,本地模型优势很直接。

隐私:客户项目、NDA 文件、内部代码不出机器。

离线:飞机、火车、咖啡店网络差时照样写代码。

无限制:没有日限额,没有频控墙,可以跑整晚。

批处理:清洗数据、重命名文件、批量重构、测试扫描。云端按 token 收费,本地免费。

小任务速度:本地首 token 常在 1 到 2 秒。云端繁忙时可能要 9 到 35 秒。快速修补时,本地更顺手。

Phase 7:什么时候还需要 Claude 云端

云端 Claude 仍然有价值。

长时间开放式任务:14B 或 32B 本地模型在长对话里更容易丢线索,Opus 更稳。

超长上下文:超过 80K tokens 后,本地模型质量容易下降。Opus 在 200K 场景更强。

高难推理:数学证明、棘手 bug、多跳逻辑,Opus 仍然领先。

视觉:本地视觉模型在接近,但截图和图表理解仍落后 Claude。

更稳的策略是默认本地,卡住时升级到云端。

零硬件方案

如果笔记本跑不动大模型,还有一条路:Ollama 现在支持云端托管的开源模型。你仍然使用 Claude Code,仍然可以 0 成本开始,但模型跑在远程服务器上。

ollama launch claude --model qwen3.5:cloud

这些模型的质量可以接近 Claude Sonnet 。代价是代码会离开本机,所以它不解决隐私问题。单纯为了省钱,这是最容易的路径:5 分钟内跑起 Claude Code,不需要本地硬件。

云端模型像租房,本地模型像买房。

账怎么算

用钱的视角看:

Claude Max:每月 100 到 200 美元,每年 1200 到 2400 美元。

Claude Code + API 重度使用:每月 60 到 200 美元,每年 720 到 2400 美元。

Cursor Pro:每月 40 美元,每年 480 美元。

本地栈:每月 0 美元,每年 0 美元。

一台二手 24GB Mac mini 低于 1000 美元。只和 Max 对比,大约 5 个月回本。之后节省下来的钱都归你。

即使保留云端 Claude 处理最难的 20%,混合方案也能把重度用户从每月约 200 美元降到约 20 美元,约等于省下 90% 。

前后变化

设置前,每次工具调用都在消耗 token 。你会犹豫要不要让 Claude 探索整个 repo,因为每次读取都要花钱。

设置后,探索免费。让它读文件、跑测试、搜索整个代码库,账单不会跟着跳。

设置前,额度限制会打断长会话。任务做到一半撞上上限,上下文也跟着断掉。

设置后,没有这类日限额。 Claude Code 可以连续跑 12 小时。

设置前,代码会发到 Anthropic 服务器。 Claude 读到的每个文件都会离开你的机器。

设置后,代码留在笔记本。本地运行带来的核心变化,是免费、无限、私密、离线。

适合谁

这套方法适合喜欢终端、愿意自己跑工具的人。

你会读 README,看到 GitHub repo 会想“我可以自己跑起来”。如果这是你的工作方式,本地栈会成为优势。

别人还在为远端模型按月付租金时,你已经把常用编码脑力搬回了自己的机器。

还有多久窗口期

开源代码模型追得很快。

2023 年,最好的本地模型和 GPT-4 差距很大。 2024 年开始可用。 2025 年,Qwen 2.5 Coder 已经接近 Claude 。到 2026 年,Qwen 3 Coder 和 DeepSeek V3 在真实工作里能达到 Opus 的 80% 到 90% 。

到 2027 年,本地模型会在多数日常任务上接近前沿模型。到 2028 年,差距会很小。

现在还有一个提前使用的窗口期。打开终端,安装 Ollama,拉一个模型,设置三个变量,运行 Claude Code 。

10 分钟后,同一个原本每月可能花掉 200 美元的工具,就可以在你的机器上免费跑起来。

来源:https://x.com/heynavtoor/status/2058862328620483069