中文

ActBERT:学习全局-局部视频-文本表示

计算机视觉与模式识别 2020-11-17 v1

摘要

本文中,我们提出 ActBERT,用于从无标注数据中自监督学习联合视频-文本表示。首先,我们利用全局动作信息催化语言文本与局部区域物体之间的相互交互。它从配对的视频序列与文本描述中揭示全局与局部视觉线索,以进行细致的视觉与文本关系建模。其次,我们引入一个纠缠 Transformer 块(ENT)来编码三类信息,即全局动作、局部区域物体与语言描述。通过从上下文信息中审慎提取线索,发现全局-局部对应关系。它迫使联合视频-文本表示感知细粒度物体以及全局人类意图。我们在下游视频与语言任务上验证 ActBERT 的泛化能力,即文本-视频片段检索、视频描述生成、视频问答、动作分割与动作步骤定位。ActBERT 显著优于当前最优方法,展示了其在视频-文本表示学习中的优越性。

关键词

引用

@article{arxiv.2011.07231,
  title  = {ActBERT: Learning Global-Local Video-Text Representations},
  author = {Linchao Zhu and Yi Yang},
  journal= {arXiv preprint arXiv:2011.07231},
  year   = {2020}
}

备注

A few new results are included