中文

将AI效率从模型中心转向数据中心压缩

计算与语言 2025-10-14 v3 人工智能 计算机视觉与模式识别

摘要

大型语言模型(LLM)和多模态LLM(MLLM)的发展历来依赖于扩大模型参数。然而,随着硬件限制约束了进一步的模型增长,计算瓶颈已转向对超长文本上下文、高分辨率图像和延长视频中自注意力的二次成本。本论文提出,人工智能(AI)的研究重点正从模型中心压缩转向数据中心压缩。我们将数据中心压缩定位为新兴范式,通过直接压缩模型训练或推理期间处理的数据量来提高AI效率。为 formalize这一转变,我们建立了一个现有效率策略的统一框架,并展示了为何这构成了长期上下文AI的关键范式变化。我们 then系统性地审阅了数据中心压缩方法的格局,分析了其在各种情景下的优势。最后,我们概述了关键挑战和有前景的未来研究方向。我们的工作旨在提供关于AI效率的新视角,综合旼有努力,并催化创新以应对不断增加的上下文长度所提出的挑战。

关键词

引用

@article{arxiv.2505.19147,
  title  = {Shifting AI Efficiency From Model-Centric to Data-Centric Compression},
  author = {Xuyang Liu and Zichen Wen and Shaobo Wang and Junjie Chen and Zhishan Tao and Yubo Wang and Tailai Chen and Xiangqi Jin and Chang Zou and Yiyu Wang and Chenfei Liao and Xu Zheng and Honggang Chen and Weijia Li and Xuming Hu and Conghui He and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2505.19147},
  year   = {2025}
}

备注

Project: \url{https://github.com/xuyang-liu16/Awesome-Token-level-Model-Compression}