量化通过降低权重或计算的数值精度减少内存与计算需求,但不同方法、硬件后端和模型架构的结果差异很大。只看到“4 bit”标签,无法推断实际可用性。

一、先写清硬件预算

记录可用内存或显存、CPU 与 GPU 类型、操作系统、并发数和最大可接受延迟。模型能加载不等于能够在目标上下文和并发下稳定运行。

二、用自己的任务样本衡量质量

通用基准只能提供参考。代码、中文长文、分类和抽取对量化误差的敏感度不同,应使用与真实任务一致的样本比较全精度与候选量化版本。

三、运行时决定实际速度

量化格式是否被硬件原生支持、是否需要反量化、KV 缓存如何分配,都会影响吞吐和延迟。文件更小不保证生成更快。

四、上下文会改变内存占用

模型权重只是内存的一部分。上下文变长时,KV 缓存和临时张量可能成为主要开销。测试必须覆盖目标上下文长度,而不是只测一句短提示。

五、保留可重复的选择记录

  • 模型与量化文件的准确版本。
  • 运行时、驱动和主要参数。
  • 硬件、上下文、并发和采样设置。
  • 任务质量、首 token 延迟、生成速度和峰值内存。

参考来源