我在本地跑开源大模型:Ollama + DeepSeek 的一次折腾

2026-06-09 · 技术探索

一个普通 Java 后端,尝试在自己电脑上跑开源大模型。聊聊 Ollama 的使用体验,以及一些踩坑记录。

标签:Ollama、DeepSeek、开源大模型、本地部署、LLM

为什么想跑本地大模型

作为一个写了几年业务代码的 Java 后端,我一直好奇一件事:能不能在自己的电脑上跑一个"自己的"大模型?

不用 API Key、不用走外网、不用花钱,数据不出本机。

于是我开始折腾。

电脑机箱的侧面照,终端命令行显示着 Ollama 和大模型 logo

我的电脑配置

说实话这个配置跑大模型,算不上强,但也不算最差。12GB 显存算是个"能跑,但跑不大"的水平。

Ollama 是什么

Ollama 是一个开源项目,一句话就是一个"一键跑大模型的工具"。它帮你把模型下载、加载、推理、暴露 API,全做了。

你不用装一堆乱七八糟的 Python 环境,不用折腾 CUDA,就一句话:

ollama run deepseek-coder:6.7b-instruct-q4_K_M

然后它就会自动下载模型并跑起来。

我跑过的模型

我试过几个模型,简单说一下感受:

模型大小(量化后)速度(tok/s)用途
llama3:8b-instruct-q4_K_M~5GB~25日常对话、代码
deepseek-coder:6.7b-instruct-q4_K_M~4GB~30写代码、查问题
qwen2.5:7b-instruct-q4_K_M~5GB~22中文任务、中文对话
phi3:14b-instruct-q4_K_M~8GB~15推理能力更强,但慢

跑起来之后能做什么

跑起来之后,Ollama 默认监听 11434 端口,提供了一个兼容 OpenAI API 的接口。

因为接口和 OpenAI 的差不多,所以你之前写的 OpenAI 客户端代码几乎不用改就能切到本地模型上。

我还试了两件事:一是配合 VS Code 的 Continue 插件做本地代码助手(完全离线);二是做本地 RAG,把一些个人笔记灌到本地向量库。

踩过的坑

它能做什么,不能做什么

能做的:个人代码助手(数据不出本机)、学习/实验 AI 应用架构、写简单文档/问答机器人、离线环境下用 AI。

不能做的:替代云端大模型(质量和速度都还是有差距)、处理大文档(本地模型上下文窗口有限)、做大规模生产应用(除非你有 GPU 集群)。

写在最后

折腾完这一圈,我最大的感受是——开源大模型发展速度真的很快。一年前你还要自己写一堆 Python 脚本才能跑起来的事,现在一个命令就能跑起来了。

作为一个普通开发者,我不需要去训练模型,但我至少要能把它用起来。这也是我写这篇文章的目的。