1704 字
约 5 分钟
0
Ollama 入门:在本地跑一个属于自己的大模型

Ollama 入门:在本地跑一个属于自己的大模型

平时我们调用大模型,一般都是:

Java 程序
   ↓
HTTP API
   ↓
OpenAI / DeepSeek / Claude
   ↓
返回结果

这种方式非常方便,但也意味着:

需要联网
需要 API Key
可能产生费用
数据需要发送到服务器

如果我们希望:

直接在自己的电脑上运行大模型。

就可以使用:

Ollama

一、Ollama 是什么?

Ollama 可以简单理解成:

一个帮助我们在本地下载、运行和管理大模型的工具。

它把原本比较麻烦的:

下载模型
配置运行环境
加载模型
GPU 加速
启动推理服务
提供 API

进行了封装。

最终我们只需要一条命令:

ollama run qwen3

就可以直接和模型聊天。

Ollama 当前支持 macOS、Windows 和 Linux,本地运行的模型数据不会因为推理本身自动发送到远程服务器。(Ollama )

整体可以理解成:

你的应用
   ↓
Ollama API
   ↓
本地模型
   ↓
CPU / GPU

二、Ollama 有什么用?

对于开发者来说,Ollama 最大的价值就是:

本地运行大模型

比如以前:

Spring Boot
    ↓
DeepSeek API
    ↓
互联网

现在可以变成:

Spring Boot
    ↓
Ollama
    ↓
本地 Qwen / Llama / Gemma

特别适合:

学习大模型开发

测试 Spring AI

开发 RAG

开发 Agent

搭建本地知识库

处理隐私数据

离线环境部署

三、安装 Ollama

安装非常简单。

Windows 可以直接下载安装程序,也可以在 PowerShell 中执行:

irm https://ollama.com/install.ps1 | iex

Linux:

curl -fsSL https://ollama.com/install.sh | sh

macOS 也可以直接从官网下载应用。官方当前 Windows 版本要求 Windows 10 或更高版本。(Ollama )

安装完成以后执行:

ollama -v

如果能够看到版本信息,说明安装成功。


四、运行第一个大模型

安装 Ollama 以后,就可以下载模型。

例如:

ollama run qwen3

第一次执行时,如果本地没有模型,Ollama 会自动下载。

下载完成以后:

>>> 你好

你好!有什么可以帮助你的吗?

这样,我们已经在自己的电脑上运行了一个大模型。

Qwen3 在 Ollama 中提供多个不同参数规模的版本,并支持 thinking、工具调用等能力。(Ollama )


五、模型大小是什么意思?

你可能会看到:

qwen3:4b
qwen3:8b
qwen3:14b
qwen3:32b

这里的:

4B
8B
14B
32B

可以简单理解成:

模型参数规模

通常模型越大:

能力更强
推理更慢
占用内存更多
对显卡要求更高

所以本地开发不一定非要追求最大的模型。

普通电脑可以先从:

ollama run qwen3:4b

或者其他较小模型开始。


六、常用 Ollama 命令

查看已经下载的模型:

ollama list

下载模型:

ollama pull qwen3

运行模型:

ollama run qwen3

删除模型:

ollama rm qwen3

查看正在运行的模型:

ollama ps

开发阶段基本掌握这些就够用了。


七、Ollama 不只是命令行

真正开发项目时,我们当然不会让 Java 去执行:

ollama run qwen3

Ollama 本身提供了 HTTP API。

默认情况下,本地服务通常可以通过:

http://localhost:11434

访问。

例如调用聊天接口:

curl http://localhost:11434/api/chat \
  -d '{
    "model": "qwen3",
    "messages": [
      {
        "role": "user",
        "content": "Java 中 HashMap 是什么?"
      }
    ]
  }'

官方模型页面也直接提供了 /api/chat 的调用示例。(Ollama )

所以整个过程其实就是:

Java
 ↓
HTTP
 ↓
localhost:11434
 ↓
Ollama
 ↓
Qwen3
 ↓
返回结果

这和调用云端大模型 API 的方式非常像。

最大的区别只是:

以前:

Java → Internet → 大模型厂商


现在:

Java → localhost → Ollama → 本地模型

八、Ollama 可以运行哪些模型?

Ollama 并不是一个大模型。

这一点一定要分清楚。

Ollama

更像:

大模型运行平台

而:

Qwen
Llama
Gemma

才是真正的大模型。

例如:

ollama run qwen3

也可以:

ollama run llama3.2

或者:

ollama run gemma3

Ollama 官方模型库目前提供 Qwen3、Llama 3.2、Gemma 3 等多个模型系列。(Ollama )

所以可以理解成:

             Qwen3
               ↑
               |
Java → Ollama ── Llama
               |
               ↓
             Gemma

以后想换模型,通常只需要换一个模型名称。


九、Ollama 和 Spring AI

如果你正在学习 Spring AI,那么 Ollama 非常适合拿来做实验。

架构可以变成:

Controller
    ↓
ChatClient
    ↓
Spring AI
    ↓
Ollama
    ↓
Qwen3

也就是说:

Spring AI

负责:

ChatClient
ChatMemory
Advisor
RAG
Tool Calling

而:

Ollama

负责:

在本地真正运行大模型

这样学习 Spring AI 时,就不一定需要每次都调用收费 API。


十、本地模型的优缺点

Ollama 最大的优势是:

部署简单
本地运行
开发方便
容易切换模型
适合学习和实验

而本地模型也有明显限制:

吃内存
吃显存
模型越大要求越高
普通电脑速度可能较慢
能力可能不如大型云端模型

所以实际项目中并不是:

本地模型一定比云模型好

而是根据场景选择。

例如:

学习 / 测试 / 隐私场景
        ↓
Ollama

高并发 / 超大模型 / 强推理
        ↓
云端 API

十一、总结

Ollama 最核心的作用其实非常简单:

降低本地运行大模型的门槛。

以前想在电脑上运行一个大模型,可能需要处理:

Python
CUDA
模型权重
推理框架
GPU 配置
服务部署

现在使用 Ollama:

ollama run qwen3

就能快速开始。

整个开发关系可以记成:

Spring Boot
      ↓
Spring AI
      ↓
Ollama
      ↓
Qwen / Llama / Gemma
      ↓
CPU / GPU

所以如果后面准备学习:

Spring AI
RAG
ChatMemory
Embedding
Tool Calling
Agent

Ollama 都非常适合充当我们的:

本地大模型运行环境。

学完 Ollama 之后,下一步就可以直接进入:

Spring Boot
+
Spring AI
+
Ollama
+
Qwen

真正让 Java 项目调用自己电脑上的本地大模型。

Ollama 入门:在本地跑一个属于自己的大模型
http://www.clxhxhhr.top/posts/614/
作者
clxstart
发布于
2026-09-14
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。