中文

并非所有比特都相等:面向推理模型的比例相关记忆优化策略

机器学习 2025-10-14 v1

摘要

虽然 4 位量化已成为非推理模型和零样本任务中跨尺度的记忆最优选择,但我们发现这一通用方案对推理模型不适用,因 KV 缓存而非模型规模才是记忆主导因素。通过在 AIME25 和 GPQA-Diamond 上系统性实验(覆盖 1,700 种推理情景),我们发现比例依赖性权衡:有效参数量低于 4B 的 8 位模型通过分配更多权重来提升准确率,而大型模型通过分配更多生成长度来提升准确率。该比例阈值还决定了并行扩展何时变得记忆高效,以及 KV 缓存驱逐是否优于 KV 量化。我们的发现表明,LLM 的记忆优化无法按尺度无关方式进行,而为推理模型提供了原则性指导:对于小型推理模型,优先模型容量而非测试时计算;对于大型模型,最大化测试时计算。我们的结果表明,针对推理模型的优化部署需要与非推理模型 fundamentally different 的策略。

关键词

引用

@article{arxiv.2510.10964,
  title  = {Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models},
  author = {Junhyuck Kim and Ethan Ewer and Taehong Moon and Jongho Park and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:2510.10964},
  year   = {2025}
}

备注

20 pages, 12 figures