中文

OneComp:生成式 AI 模型压缩的一行革命

机器学习 2026-04-01 v1 人工智能 计算工程、金融与科学 计算与语言

摘要

部署基础模型日益受到内存占用、延迟和硬件成本的限制。训练后压缩可以通过降低模型参数的精度来缓解这些瓶颈,而不会显著降低性能;然而,其实际实现仍然具有挑战性,因为从业者需要在碎片化的量化算法、精度预算、数据驱动的校准策略和硬件依赖的执行方案之间进行导航。我们提出了 OneComp,一个开源压缩框架,将这一专家工作流转化为可复现、资源自适应的流水线。给定模型标识符和可用硬件,OneComp 自动检查模型、规划混合精度分配,并执行渐进量化阶段,从逐层压缩到逐块细化和全局细化。一个关键架构选择是将第一个量化检查点作为可部署的枢纽,确保每个后续阶段改进同一模型,并且随着更多计算投入质量不断提高。通过将最先进的压缩研究转化为可扩展的开源、硬件感知的流水线,OneComp 弥合了算法创新与生产级模型部署之间的差距。

关键词

引用

@article{arxiv.2603.28845,
  title  = {OneComp: One-Line Revolution for Generative AI Model Compression},
  author = {Yuma Ichikawa and Keiji Kimura and Akihiro Yoshida and Yudai Fujimoto and Hiroki Tokura and Yamato Arai and Yoshiyuki Ishii and Yusei Kawakami and Genki Shikada and Achille Jacquemond and Yoshihiko Fujisawa and Katsuki Fujisawa and Takumi Honda and Akira Sakai},
  journal= {arXiv preprint arXiv:2603.28845},
  year   = {2026}
}

备注

31 pages, 6 figures