中文

为视频-语言任务学习轨迹-词对齐

计算机视觉与模式识别 2023-03-10 v3

摘要

在视频中,物体通常表现为轨迹,即它跨越若干空间但更长时间的图像块,其中包含丰富的时空上下文。然而,现代视频-语言 BERT(VDL-BERTs)忽视了这一轨迹特性,它们通常沿用图像-语言 BERT(IL-BERTs)部署块到词(P2W)注意力,可能过度利用琐碎的空间上下文而忽略重要的时间上下文。为修正此问题,我们提出一种新颖的 TW-BERT,通过新设计的轨迹到词(T2W)注意力来学习轨迹-词对齐,以求解视频-语言任务。此外,先前的 VDL-BERTs 通常均匀采样若干帧送入模型,而不同轨迹具有多样的粒度,即某些轨迹跨越更长帧数、某些跨越更短,使用少量帧会丢失部分有用的时间上下文。然而,简单地采样更多帧也会因训练负担大幅增加而使预训练不可行。为缓解该问题,在微调阶段我们将一种新颖的分层帧选择器(HFS)模块插入视频编码器。HFS 以文本上下文为条件逐步选择合适的帧,供后续跨模态编码器学习更好的轨迹-词对齐。通过所提出的 T2W 注意力与 HFS,我们的 TW-BERT 在文本到视频检索任务上取得了 SOTA 性能,并在视频问答任务上取得了与某些以远多数据训练的 VDL-BERTs 相当的性能。代码将在补充材料中提供。

关键词

引用

@article{arxiv.2301.01953,
  title  = {Learning Trajectory-Word Alignments for Video-Language Tasks},
  author = {Xu Yang and Zhangzikang Li and Haiyang Xu and Hanwang Zhang and Qinghao Ye and Chenliang Li and Ming Yan and Yu Zhang and Fei Huang and Songfang Huang},
  journal= {arXiv preprint arXiv:2301.01953},
  year   = {2023}
}