量化通过降低权重或计算的数值精度减少内存与计算需求,但不同方法、硬件后端和模型架构的结果差异很大。只看到“4 bit”标签,无法推断实际可用性。
一、先写清硬件预算
记录可用内存或显存、CPU 与 GPU 类型、操作系统、并发数和最大可接受延迟。模型能加载不等于能够在目标上下文和并发下稳定运行。
二、用自己的任务样本衡量质量
通用基准只能提供参考。代码、中文长文、分类和抽取对量化误差的敏感度不同,应使用与真实任务一致的样本比较全精度与候选量化版本。
三、运行时决定实际速度
量化格式是否被硬件原生支持、是否需要反量化、KV 缓存如何分配,都会影响吞吐和延迟。文件更小不保证生成更快。
四、上下文会改变内存占用
模型权重只是内存的一部分。上下文变长时,KV 缓存和临时张量可能成为主要开销。测试必须覆盖目标上下文长度,而不是只测一句短提示。
五、保留可重复的选择记录
- 模型与量化文件的准确版本。
- 运行时、驱动和主要参数。
- 硬件、上下文、并发和采样设置。
- 任务质量、首 token 延迟、生成速度和峰值内存。
参考来源
- Dettmers 等:LLM.int8(),访问于 2026-07-29。
- Transformers Quantization Overview,访问于 2026-07-29。