我在本地跑开源大模型:Ollama + DeepSeek 的一次折腾
2026-06-09 · 技术探索
一个普通 Java 后端,尝试在自己电脑上跑开源大模型。聊聊 Ollama 的使用体验,以及一些踩坑记录。
标签:Ollama、DeepSeek、开源大模型、本地部署、LLM
为什么想跑本地大模型
作为一个写了几年业务代码的 Java 后端,我一直好奇一件事:能不能在自己的电脑上跑一个"自己的"大模型?
不用 API Key、不用走外网、不用花钱,数据不出本机。
于是我开始折腾。

我的电脑配置
- CPU:AMD 3600
- 显卡:NVIDIA RTX 3060 12GB
- 内存:32GB
- 系统:Windows 11 / WSL2
说实话这个配置跑大模型,算不上强,但也不算最差。12GB 显存算是个"能跑,但跑不大"的水平。
Ollama 是什么
Ollama 是一个开源项目,一句话就是一个"一键跑大模型的工具"。它帮你把模型下载、加载、推理、暴露 API,全做了。
你不用装一堆乱七八糟的 Python 环境,不用折腾 CUDA,就一句话:
ollama run deepseek-coder:6.7b-instruct-q4_K_M
然后它就会自动下载模型并跑起来。
我跑过的模型
我试过几个模型,简单说一下感受:
| 模型 | 大小(量化后) | 速度(tok/s) | 用途 |
|---|
| llama3:8b-instruct-q4_K_M | ~5GB | ~25 | 日常对话、代码 |
| deepseek-coder:6.7b-instruct-q4_K_M | ~4GB | ~30 | 写代码、查问题 |
| qwen2.5:7b-instruct-q4_K_M | ~5GB | ~22 | 中文任务、中文对话 |
| phi3:14b-instruct-q4_K_M | ~8GB | ~15 | 推理能力更强,但慢 |
跑起来之后能做什么
跑起来之后,Ollama 默认监听 11434 端口,提供了一个兼容 OpenAI API 的接口。
因为接口和 OpenAI 的差不多,所以你之前写的 OpenAI 客户端代码几乎不用改就能切到本地模型上。
我还试了两件事:一是配合 VS Code 的 Continue 插件做本地代码助手(完全离线);二是做本地 RAG,把一些个人笔记灌到本地向量库。
踩过的坑
- 显存不够,就别跑大模型:一开始尝试跑 70B,加载模型花了 20 多分钟,然后推理一句话要几十秒。劝退。
- WSL2 下的 CUDA 配置让我折腾了一下午。
- 量化不是没有代价:Q4 量化让模型能跑起来了,但回答质量相比 Q8 或 FP16 是有下降的。
- 速度和云端 API 还是有差距:即便跑 7B 模型,速度大概 20-30 tokens/s,而云端 API 是几百 tokens/s。
它能做什么,不能做什么
能做的:个人代码助手(数据不出本机)、学习/实验 AI 应用架构、写简单文档/问答机器人、离线环境下用 AI。
不能做的:替代云端大模型(质量和速度都还是有差距)、处理大文档(本地模型上下文窗口有限)、做大规模生产应用(除非你有 GPU 集群)。
写在最后
折腾完这一圈,我最大的感受是——开源大模型发展速度真的很快。一年前你还要自己写一堆 Python 脚本才能跑起来的事,现在一个命令就能跑起来了。
作为一个普通开发者,我不需要去训练模型,但我至少要能把它用起来。这也是我写这篇文章的目的。