具有低计算成本保证的多模态 Transformer
机器学习
2024-02-26 v1 计算机视觉与模式识别
多媒体
摘要
基于 Transformer 的模型在视觉问答和动作识别等一系列多模态理解任务中显著提升了性能。然而,多模态 Transformer 的多头注意力机制随输入序列长度呈现二次复杂度,这一问题随着模态数量的增加而愈发严重。为解决此问题,我们引入了低成本低多模态 Transformer(LoCoMT),这是一种旨在以最小的性能损失降低训练和推理计算成本的新型多模态注意力机制。具体而言,通过为每个注意力头分配不同的多模态注意力模式,LoCoMT 能够灵活控制多模态信号,并在理论上确保相比现有的多模态 Transformer 变体降低计算成本。在 Audioset 和 MedVidCL 两个多模态数据集上的实验结果表明,LoCoMT 不仅减少了 GFLOPs,而且性能匹配甚至超越了现有模型。
引用
@article{arxiv.2402.15096,
title = {Multimodal Transformer With a Low-Computational-Cost Guarantee},
author = {Sungjin Park and Edward Choi},
journal= {arXiv preprint arXiv:2402.15096},
year = {2024}
}
备注
Accepted to ICASSP 2024 (5 pages)