MutualFormer:基于交叉扩散注意力的多模态表征学习
计算机视觉与模式识别
2023-03-17 v3
摘要
聚合多模态数据以获得可靠的数据表征正受到越来越多的关注。近期研究表明 Transformer 模型通常能很好地胜任多模态任务。现有 Transformer 一般采用交叉注意力(CA)机制或简单拼接来实现不同模态间的信息交互,通常忽略了模态间隙问题。本文重新思考 Transformer 并将其扩展为用于多模态数据表征的 MutualFormer。与 Transformer 中的 CA 不同,MutualFormer 采用我们新设计的交叉扩散注意力(CDA)来实现不同模态间的信息通信。与 CA 相比,所提 CDA 的主要优势有三个方面。首先,CDA 中的交叉亲和度基于度量空间中各独立模态亲和度定义,从而可自然避免基于特征的 CA 定义中的模态/域间隙问题。其次,CDA 提供了一种通用方案,既可用于多模态表征,也可作为现有 CA 模型的后优化。第三,CDA 实现高效。我们成功将 MutualFormer 应用于不同的多模态学习任务(即 RGB-深度 SOD、RGB-NIR 物体 ReID)。大量实验证明了所提 MutualFormer 的有效性。
引用
@article{arxiv.2112.01177,
title = {MutualFormer: Multi-Modality Representation Learning via Cross-Diffusion Attention},
author = {Xixi Wang and Xiao Wang and Bo Jiang and Jin Tang and Bin Luo},
journal= {arXiv preprint arXiv:2112.01177},
year = {2023}
}