门控递归融合:面向大规模多模态 Transformer 的一种有状态方法
计算机视觉与模式识别
2025-07-08 v1 人工智能
计算与语言
摘要
多模态学习面临一种根本性张力:深入、细粒度的融合与计算可扩展性之间的平衡。虽然交叉注意力模型通过穷尽的两两融合实现了卓越的性能,但其二次复杂度在模态数量众多的场景下变得不可接受。我们通过门控递归融合(Gated Recurrent Fusion, GRF)来解决这一挑战,这是一种在线性可扩展性、递归管道中捕捉交叉模态注意力力量的新型架构。该方法顺序处理各模态,在每一步中更新不断演化的多模态上下文向量。其核心是 built on Transformer Decoder 层的融合模块,执行对称交叉注意力,互相丰富共享上下文与进入的模态。这种丰富信息随后通过门控融合单元(Gated Fusion Unit, GFU)集成,该单元是一种受 GRU 启发的机制,动态仲裁信息流,使模型能够选择性地保留或丢弃特征。这种有状态、递归设计相对于模态数量呈线性增长 O(n),因此非常适用于高模态环境。在 CMU-MOSI 基准测试上进行实验,表明 GRF 在性能上与更复杂的基线方法相当。对嵌入空间的可视化进一步说明,GRF 通过其渐进式融合机制创建了结构化、可分离的类别表示。我们的工作为强大且高效的多模态表征学习提供了一种稳健且高效的范式。
引用
@article{arxiv.2507.02985,
title = {Gated Recursive Fusion: A Stateful Approach to Scalable Multimodal Transformers},
author = {Yusuf Shihata},
journal= {arXiv preprint arXiv:2507.02985},
year = {2025}
}
备注
13 pages, 2 figures