中文

用于视频-音频无监督学习的跨模态注意力一致性

计算机视觉与模式识别 2021-06-15 v1

摘要

跨模态相关性为视频无监督表征学习提供了固有的监督信号。现有方法侧重于通过视觉和音频表征来区分不同的视频片段。人类视觉感知能够关注到发声区域,而听觉感知也能将其定位于发声物体的频率,我们称之为双向局部对应。这种监督信号很直观,但在对比学习框架中尚未得到充分探索。本文引入了一个预训练任务——跨模态注意力一致性(CMAC),用于探索双向局部对应特性。CMAC方法旨在将纯视觉信号生成的区域注意力与在声学信号引导下的目标注意力进行对齐,并对声学注意力上的频率定位做类似的对齐。配合重构的跨模态对比损失(其中我们考虑了额外的模态内交互),CMAC方法能有效实现双向对齐。在六个下游基准上的大量实验表明,CMAC能够提升视觉和音频模态上的SOTA性能。

关键词

引用

@article{arxiv.2106.06939,
  title  = {Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning},
  author = {Shaobo Min and Qi Dai and Hongtao Xie and Chuang Gan and Yongdong Zhang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2106.06939},
  year   = {2021}
}