中文

视频-文本即博弈玩家:面向跨模态表征学习的层次化 Banzhaf 交互

计算机视觉与模式识别 2023-03-28 v1 多媒体

摘要

基于对比学习的视频-语言表征学习方法(如 CLIP)已取得优异性能,其在预定义的视频-文本对上追求语义交互。为厘清这种粗粒度全局交互并更进一步,我们必须应对细粒度跨模态学习中具有破壳性的挑战性交互。本文中,我们创造性地将视频-文本建模为博弈玩家,借助多元合作博弈理论,明智地处理细粒度语义交互中伴随的多样性粒度、灵活组合与模糊强度所带来的不确定性。具体而言,我们提出层次化 Banzhaf 交互(HBI),以评估视频帧与文本词之间可能的对应关系,实现敏感且可解释的跨模态对比。为高效实现多视频帧与多文本词的合作博弈,所提方法对原始视频帧(文本词)进行聚类,并计算合并后词元之间的 Banzhaf 交互。通过堆叠词元合并模块,我们在不同语义层级上实现了合作博弈。在常用文本-视频检索与视频问答基准上的大量实验及其优越性能,验证了 HBI 的有效性。更令人鼓舞的是,它还可作为可视化工具促进对跨模态交互的理解,这对社区具有深远影响。项目页面见 https://jpthu17.github.io/HBI/。

关键词

引用

@article{arxiv.2303.14369,
  title  = {Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation Learning},
  author = {Peng Jin and Jinfa Huang and Pengfei Xiong and Shangxuan Tian and Chang Liu and Xiangyang Ji and Li Yuan and Jie Chen},
  journal= {arXiv preprint arXiv:2303.14369},
  year   = {2023}
}

备注

CVPR 2023 Highlight