中文

Mamba融合:通过提问学习动作

计算机视觉与模式识别 2025-02-03 v2 人工智能

摘要

视频语言模型(VLM)对于跨多样化任务泛化以及利用语言线索增强学习至关重要。虽然基于Transformer的架构一直是视觉-语言训练的事实标准,但它们面临着二次计算复杂度、高GPU内存占用以及难以处理长期依赖等挑战。为了解决这些局限性,我们引入了MambaVL,这是一种新颖的模型,它利用选择性状态空间模态融合的最新进展,以高效捕捉长程依赖关系并学习视觉和语言数据的联合表示。MambaVL利用一个跨两种模态的共享状态转移矩阵,使模型能够从场景内的多个视角捕捉关于动作的信息。此外,我们提出了一个问答任务,帮助引导模型关注相关线索。这些问题提供了关于动作、物体和环境背景的关键信息,从而提升了性能。因此,MambaVL在Epic-Kitchens-100数据集上的动作识别任务中达到了最先进的性能,并在动作预测任务中优于基线方法。

关键词

引用

@article{arxiv.2409.11513,
  title  = {Mamba Fusion: Learning Actions Through Questioning},
  author = {Zhikang Dong and Apoorva Beedu and Jason Sheinkopf and Irfan Essa},
  journal= {arXiv preprint arXiv:2409.11513},
  year   = {2025}
}