RollingQ:在多模态 Transformer 中复活合作动力学
机器学习
2025-06-16 v1 人工智能
计算机视觉与模式识别
摘要
多模态学习面临在模态质量在不同样本中变化的情况下有效融合来自不同模态的信息的挑战。动态融合策略, 如 Transformer 中的注意力机制, 旨在通过根据输入数据的特征自适应地强调特定模态来解决此挑战。然而, 通过大量精心设计的实验, 我们惊讶地发现, 广泛使用的自注意力模型的动态可适应性会逐渐下降。模型倾向于无论数据特征如何, 都偏好一种模态。这种偏见会触发自强化循环, 逐渐放大 favored 模态的注意力, 从而扩大注意力键在不同模态之间的分布差距, 并使注意力机制的动态属性失效。为复活可适应性, 我们提出了一种简单而有效的方法 Rolling Query (RollingQ), 通过旋转查询来平衡注意力分配, 以打破自强化循环并减轻 key 分布差距。对各种多模态情景进行的广泛实验验证了 RollingQ 的有效性, 并恢复合作动力学对于增强广泛部署的多模态 Transformer 的更广泛能力至关重要。源代码可在 https://github.com/GeWu-Lab/RollingQ_ICML2025 获取。
引用
@article{arxiv.2506.11465,
title = {RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer},
author = {Haotian Ni and Yake Wei and Hang Liu and Gong Chen and Chong Peng and Hao Lin and Di Hu},
journal= {arXiv preprint arXiv:2506.11465},
year = {2025}
}
备注
Accepted by ICML 2025