GeminiFusion:面向视觉Transformer的高效逐像素多模态融合
计算机视觉与模式识别
2024-06-05 v2
摘要
跨模态Transformer通过有效整合不同模态,已在多种视觉任务中展现出优越性。本文首先批评了先前的令牌交换方法——这些方法用跨模态特征替换信息量较少的令牌,并证明基于交换的方法性能不如交叉注意力机制,而后者计算需求不可避免地限制了其在较长序列上的使用。为克服计算挑战,我们提出GeminiFusion,一种利用对齐的跨模态表示的逐像素融合方法。GeminiFusion优雅地结合了模态内和模态间注意力,动态整合跨模态的互补信息。我们采用逐层自适应噪声来按层自适应地控制它们之间的相互作用,从而实现和谐的融合过程。值得注意的是,GeminiFusion在输入令牌数量上保持线性复杂度,确保该多模态框架的运行效率与单模态网络相当。在多模态图像到图像翻译、3D目标检测和任意模态语义分割任务(包括RGB、深度、LiDAR、事件数据等)上的全面评估表明,我们的GeminiFusion相比前沿技术具有优越性能。PyTorch代码可在https://github.com/JiaDingCN/GeminiFusion获取。
引用
@article{arxiv.2406.01210,
title = {GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer},
author = {Ding Jia and Jianyuan Guo and Kai Han and Han Wu and Chao Zhang and Chang Xu and Xinghao Chen},
journal= {arXiv preprint arXiv:2406.01210},
year = {2024}
}
备注
Accepted by ICML 2024, code and models are available at https://github.com/JiaDingCN/GeminiFusion