2149 字
约 7 分钟
1
Ollama 与 LM Studio 怎么上手
无标签

开源专题 · 在自己的机器上跑起来 Ollama 与 LM Studio 怎么上手 上一节算出了你能跑什么,这一节把它装起来。两个工具,一个命令行一个图形界面,第一次用十分钟能跑通。 一句话速览 从安装到跑通的完整命令、模型标签的读法、量化档位怎么选,以及三个最常见的坑 先选工具

Ollama

命令行

一条命令下载并运行,没有多余步骤 装好后自动在后台提供服务,可以直接被程序调用 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用 没有图形界面,换模型、调参数都要敲命令

适合你,如果: 你要把本地模型接进自己的程序,或者习惯用终端。

LM Studio

图形界面

内置模型浏览器,能看到体积和量化档位再决定下不下 会提示当前机器能不能带得动,对新手很友好 也能开本地服务器,同样兼容 OpenAI 格式 在 Apple 芯片上支持 MLX 引擎,比通用格式更快

适合你,如果: 你想先试几个模型比较一下,或者不想碰命令行。

不用纠结,两个可以都装。 它们下载的模型文件互不冲突,很多人用 LM Studio 挑模型和试效果,用 Ollama 跑常驻服务。

Ollama:从零到跑通

装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例:

下载并直接开始对话

复制

ollama run qwen3:8b

就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull 。其余常用命令:

日常管理

复制

# 看已经下载了哪些模型,以及各占多少空间
ollama list

# 删掉不用的,本地模型很占硬盘
ollama rm qwen3:8b

# 看当前正在占用显存的模型
ollama ps

装好后 Ollama 会在本机 11434 端口提供服务,接口格式跟 OpenAI 一致。也就是说你手上现成的 OpenAI 调用代码,把 base_url 指过来就能跑,模型名填标签名即可。

用现成的 OpenAI SDK 调本地模型

复制

from openai import OpenAI

# 本地服务不校验密钥,api_key 随便填一个非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

resp = client.chat.completions.create(
 model="qwen3:8b",
 messages=[{"role": "user", "content": "用一句话解释什么是量化"}],
)
print(resp.choices[0].message.content)

上面那条命令里的 8b 是举例。你自己该敲哪个数字,取决于你的机器。选一下,下面直接给出你能复制走的那条。

选完直接点复制,这条命令装好 Ollama 就能用。

平台

NVIDIA 显卡 Apple Silicon

型号

主要用途

日常问答 写代码 / 数学

复制


把上面那个选择器里的机型换着点一遍,会看出一件反直觉的事: 决定你能跑多大模型的不是显卡多贵,是显存多大。 一张 RTX 4090 停在 30B,而一台统一内存 128 GB 的 Mac 能吃下 122B——后者的图形算力远不如前者,但模型装得进去,前者装不进去。

同样是 INT4,两台机器的上限

RTX 4090(24 GB 显存)→ 最大 Qwen3-30B-A3B ,需 19.5 GB Mac 统一内存 128 GB(约 96 GB 可用)→ 最大 Qwen3.5-122B-A10B ,需 79.3 GB

这也是大内存 Mac 在本地跑模型这件事上唯一说得通的理由。它的优势不是快,是 装得下 :同样的钱买独显,显存到 24 GB 就到头了,而统一内存能堆到 128 GB 以上,中间这一段没有别的消费级设备能补。 如果你的用途就是在本地跑大尺寸模型,内存容量比 GPU 型号重要得多。

上面的推荐只登记了 Ollama 官方库里确实存在的标签 ,核对日期 2026-08-07,来源 ollama.com/library。给一条拉不下来的命令比不给更糟。

标签怎么读

冒号后面那串不是随便写的,每一段都有含义。

qwen3 : 30b-a3b - q4_K_M

qwen3 模型系列名。 30b-a3b 尺寸。带 a 的是 MoE,这里表示总参数 30B、激活 3B。上一节讲过,显存要按 30B 准备。 q4_K_M 量化档位。不写的话会用默认档,见下一段。

第一个坑:你跑的默认就是量化版。 不写量化后缀时,Ollama 拉的通常是 Q4 档,不是原始精度。很多人拿它跟官方 API 的效果比,觉得开源模型不行,其实比的根本不是同一个东西。 要对比质量,先确认两边跑的是不是同一个档位。

量化档位怎么选

Q4_K_M 默认选它。 体积和质量的平衡点,绝大多数工具的默认档。日常问答、总结、改写这类任务上够用。

Q5_K_M 体积略大,质量更稳。 如果你主要拿来写代码或做数学题,选这一档更保险 ,这两类任务对精度损失比较敏感。

Q8_0 接近原始质量,体积也接近翻倍。显存充裕又想要最好效果时用。

Q3 及以下 除非显存实在不够,否则不建议。掉分开始明显,还不如换个小一号的模型跑高一档量化。

一条实用规律:模型越大,量化越安全。 32B 模型量化到 Q4 掉的那点分,往往还是比 8B 跑 Q8 强。所以显存有限时,优先保尺寸,再考虑档位。

可用标签会随版本更新,实际拉取前建议到 ollama.com/library 对应模型的 tags 页确认当前有哪些尺寸与档位。核对日期 2026-08-07。

LM Studio:点几下就行

1

在模型库里搜索 搜模型名,列表会列出各个量化版本的体积。界面会根据你的机器提示哪些带得动,这一点比命令行直观很多。

2

下载后直接聊天 加载模型时可以调上下文长度和 GPU 分配。这两个参数直接影响显存占用,先用默认值跑通再调。

3

需要给程序调用时,开本地服务器 在服务器面板里启动,同样是 OpenAI 兼容接口,用法和上面的 Ollama 例子一样,只是端口不同。

4

Mac 用户注意选 MLX 版本 如果模型有 MLX 格式,优先选它。这是针对 Apple 芯片优化的引擎,同样的模型速度会明显好于通用格式。

还有三个常见的坑

上下文开太大,显存直接爆。 这是最高频的问题。模型加载时显存看着够,一旦把上下文拉到几十 K,KV Cache 涨上来就崩了。现象是生成到一半卡死,或者速度突然慢到不可用。 先按默认上下文跑通,需要长文再一档一档往上加。 显存不够时不一定报错。 有些工具会自动把装不下的部分放到内存里,靠 CPU 算。结果是能跑,但慢十倍以上。如果你发现生成速度慢得离谱,先检查是不是没完全装进显存。 硬盘会被吃掉。 一个 8B 的 Q4 模型三四个 GB,试几个模型就是几十个 GB。定期用 ollama list 看一眼,不用的删掉。

三条路,什么时候走哪条

到这里,你手上有三种用模型的方式了。它们不是替代关系,各有各的场合:

本地跑。 数据不能外发、要长期高频调用、或者想完全不受服务商影响时。代价是能力上限受硬件限制。 官方 API。 要最强能力、不想管运维时。按量付费,用多少算多少。 中转站。 便利性和风险并存,具体的取舍在 《什么是 API 中转站》 那一节讲过,涉及数据经手第三方的问题,选之前建议回去再看一眼。

这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来。

Ollama 与 LM Studio 怎么上手
http://www.clxhxhhr.top/posts/4084/
作者
clxstart
发布于
2026-09-25
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。