Skip to content

本地大模型量化部署

版本说明

本文档基于 Obsidian v1.13(稳定版)整理,功能可能随版本更新,建议结合官方说明实践。

量化等级

精度显存(7B)质量速度
Q88 GB接近原版
Q4_K_M4.5 GB良好
Q2_K3 GB可接受最快

llama.cpp 示例

bash
./llama-cli -m model-q4_k_m.gguf -p "总结这段笔记" -ngl 35

显存估算

7B-Q4 ≈ 4.5GB;14B-Q4 ≈ 9GB;需预留 1-2GB 上下文。无独显可用 CPU(慢 5-10 倍)。