中文

面向通用视频语言表征学习的层次化班托夫相互作用

计算机视觉与模式识别 2025-01-01 v1

摘要

多模态表征学习以对比学习为重要方式,在人工智能领域发挥重要作用。作为其重要子领域,视频语言表征学习专注于利用预定义的视频文本对之间的全局语义相互作用来学习表征。然而,为了增强和细化这些粗粒度的全局相互作用,就需要更细致的相互作用来实现细粒度的多模态学习。本研究引入了一种新方法,通过多变量合作博弈论将视频文本建模为游戏玩家,以处理在细粒度语义相互作用中的不确定性,这些相互作用具有多样的粒度、灵活的组合和模糊的强度。具体而言,我们设计了层次化班托夫相互作用,从层次化视角模拟视频片段与文本单词之间的细粒度对应关系。此外,为了缓解班托夫相互作用计算中的偏差,我们提出通过单模态和跨模态组件的融合来重构表征。这种重构的表征在保持跨模态表征的自适应编码特性的同时,确保与单模态表征相当的细粒度。我们进一步将原始结构扩展为灵活的编码器-解码器框架,使模型能够适应各种下游任务。在常用的文本-视频检索、视频问答和视频字幕基准测试上进行了大量实验,结果在性能优异,验证了我们方法的有效性和通用性。

关键词

引用

@article{arxiv.2412.20964,
  title  = {Hierarchical Banzhaf Interaction for General Video-Language Representation Learning},
  author = {Peng Jin and Hao Li and Li Yuan and Shuicheng Yan and Jie Chen},
  journal= {arXiv preprint arXiv:2412.20964},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). arXiv admin note: substantial text overlap with arXiv:2303.14369