模型權重壓縮率(Model Weight Compression Ratio)是指把 AI 模型的權重(Weights)壓縮到比原始模型更小的程度,目的是減少儲存空間、記憶體占用以及提升推論速度。
量化壓縮(Quantization)
現在 Local AI 幾乎都是利用量化來壓縮模型。
例如一個模型原本使用 FP16(16 位元浮點數):
每個權重需要 16 bits= 2Bytes
假設有 80 億個參數(8B),共需要 8Gx2B= 16 GB
權重如果改成 Q4(4-bit), 共需要 8Gx 0.5B= 4 GB
常見量化格式
常見的量化格式
|
量化格式 |
每個權重 |
相較 FP32大小 |
一般聊天 |
寫程式 |
數學/推理 |
適合用途 |
|---|---|---|---|---|---|---|
|
FP32 |
32 bit |
100% |
★★★★★ |
★★★★★ |
★★★★★ |
訓練、最高精度推論 |
|
FP16 |
16 bit |
50% |
★★★★★ |
★★★★★ |
★★★★★ |
GPU 推論、高品質 |
|
Q8 |
8 bit |
25% |
★★★★★ |
★★★★☆ |
★★★★☆ |
品質接近 FP16,需要較多記憶體 |
|
Q6 |
6 bit |
18.75% |
★★★★☆ |
★★★★☆ |
★★★★☆ |
品質與大小取得良好平衡 |
|
Q5 |
5 bit |
15.6% |
★★★★☆ |
★★★★☆ |
★★★★☆ |
品質優於 Q4,記憶體需求適中 |
|
Q4 |
4 bit |
12.5% |
★★★★☆ |
★★★☆☆ |
★★★☆☆ |
Local AI 最受歡迎的平衡點 |
|
Q3 |
3 bit |
9.4% |
★★★☆☆ |
★★☆☆☆ |
★★☆☆☆ |
僅適合記憶體有限的環境 |
|
Q2 |
2 bit |
6.25% |
★★☆☆☆ |
★☆☆☆☆ |
★☆☆☆☆ |
極度節省空間,但能力下降明顯 |
- RAG、聊天、翻譯、摘要 → Q4
- 程式開發、Agent、自動化工作流 → Q5 或 Q6
- 追求最高品質且硬體充足 → Q8 或 FP16
壓縮不只有量化
除了量化,還有其他壓縮技術,例如:
Pruning(剪枝):移除影響較小的權重或神經元。
Knowledge Distillation(知識蒸餾):用大型模型訓練一個較小的模型,而不是直接壓縮原模型。
Low-rank Compression(低秩分解):利用矩陣分解減少參數量。
Weight Sharing(權重共享):讓多個參數共用同一組權重。