本地大模型实战:用 Ollama 在 NAS 上部署 Llama 3.2

本地大模型实战:用 Ollama 在 NAS 上部署 Llama 3.2

为什么要在本地跑大模型?

Cloud API 虽好,但隐私和成本是硬伤。2026 年的今天,消费级硬件已经能流畅运行 7B-11B 参数模型,NAS 玩家是时候把 AI 算力收回本地了。

硬件要求与性能对比

实测数据(Mac Studio M2 32GB vs 群晖 DS920+ 16GB):

设备 模型 量化 显存占用 生成速度
Mac Studio M2 Llama 3.2 11B Q4_K_M 8.2GB 28 tokens/s
群晖 DS920+ Llama 3.2 3B Q4_K_M 2.1GB 12 tokens/s
群晖 DS920+ Qwen2.5 7B Q3_K_S 4.5GB 6 tokens/s

三步部署 Ollama

Step 1:Docker 安装

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Step 2:拉取模型

docker exec -it ollama ollama pull llama3.2:3b

Step 3:API 调用测试

curl http://localhost:11434/api/generate -d {"model": "llama3.2:3b","prompt": "用 Python 写一个快速排序","stream": false}

成本账

Cloud API:GPT-4o 约 $0.03/1K tokens,月读 10 万字 ≈ $30
本地部署:一次性硬件投入,电费每月 ≈ ¥50,隐私零风险。

2026 年,本地 AI 不再是极客玩具,而是生产力标配。你的 NAS 准备好上岗了吗?

Comments

No comments yet. Why don’t you start the discussion?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注