中文

蚂蚁集团通过高效剪枝与蒸馏压缩大型多模态模型

人工智能 2024-06-26 v2

摘要

大型多模态模型 (Large Multimodal Models, LMMs) 在蚂蚁集团的部署显著推进了支付、安全和广告领域的多模态任务,特别是提升了支付宝的广告审查任务。然而,如此庞大模型的部署带来了挑战,尤其是在延迟增加和碳排放方面,这与绿色 AI 的理念背道而驰。本文介绍了针对我们自研的 LMM——AntGMM 的一种新颖的多阶段压缩策略。我们的方法主要围绕三个方面:采用小训练样本量、通过多阶段剪枝处理多级冗余,以及引入先进的蒸馏损失设计。在我们的研究中,我们从支付宝的真实场景构建了多模态广告审查数据集 (Multimodal Advertisement Audition Dataset, MAAD),并进行了实验以验证所提策略的可靠性。此外,我们策略的有效性还体现在其于 2023 年 9 月起连续三个月在支付宝真实世界的多模态广告审查中的运营成功。值得注意的是,我们的方法实现了延迟的大幅降低,从 700ms 降至 90ms,同时仅以轻微的性能下降维持了在线表现。此外,与直接部署 AntGMM 相比,我们的压缩模型预计每年可减少约 7500 万千瓦时的电力消耗,彰显了我们对绿色 AI 倡议的承诺。经过一些审查后,我们将公开发布我们的代码和 MAAD 数据集\footnote{https://github.com/MorinW/AntGMM_\_Pruning}。

关键词

引用

@article{arxiv.2312.05795,
  title  = {Large Multimodal Model Compression via Efficient Pruning and Distillation at AntGroup},
  author = {Maolin Wang and Yao Zhao and Jiajia Liu and Jingdong Chen and Chenyi Zhuang and Jinjie Gu and Ruocheng Guo and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2312.05795},
  year   = {2024}
}