UniMoD:高效统一多模态Transformer的深度混合模式
计算机视觉与模式识别
2025-02-11 v1
摘要
统一多模态Transformer能够在共享参数空间中处理生成和理解任务,近年来受到广泛关注。尽管提出了各种统一Transformer,但由于冗余token和重型注意力计算,训练这些模型代价高昂。过去,大型语言模型研究表明,诸如Mixture of Depths (MoD)等token剪枝方法可显著提高计算效率。MoD采用路由器选择Transformer层中最重要的token进行处理。然而,直接将基于MoD的token剪枝应用于统一Transformer会导致次优性能,因为不同任务对token冗余度的影响各异。我们通过(1)检查注意力权重模式、(2)评估层重要性和token冗余度、(3)分析任务相互作用来分析统一Transformer。我们的发现表明,token冗余主要受任务和层的影响。基于这些发现,我们引入UniMoD,一种基于任务的token剪枝方法,为每个任务设置独立路由器以确定应剪枝的token。我们将方法应用于Show-o和Emu3,在Show-o中将训练FLOPs降低约15%,在Emu3中降低约40%,同时在多个基准测试中保持或提升性能。代码将在https://github.com/showlab/UniMoD发布。
引用
@article{arxiv.2502.06474,
title = {UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths},
author = {Weijia Mao and Zhenheng Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2502.06474},
year = {2025}
}