中文

用于音视频视频解析的跨模态学习

声音 2021-06-22 v2 计算机视觉与模式识别 机器学习 音频与语音处理 图像与视频处理

摘要

本文提出一种用于音视频视频解析(AVVP)任务的新方法,该任务将视频中的事件针对音频和视觉模态分别划分。所提出的解析方法同时检测此类事件的起止时间边界。我们展示了 AVVP 如何受益于以下旨在有效跨模态学习的技术:(i)对抗训练与跳跃连接;(ii)全局上下文感知注意力;以及(iii)使用音视频定位目标进行自监督预训练以获得跨模态音视频表示。我们在 Look, Listen, and Parse(LLP)数据集上给出了大量实验评估,表明我们在 AVVP 所提出的全部五项指标上均优于最先进的混合注意力网络(HAN)。我们还给出了若干消融实验以验证预训练、全局注意力和对抗训练的作用。

关键词

引用

@article{arxiv.2104.04598,
  title  = {Cross-Modal learning for Audio-Visual Video Parsing},
  author = {Jatin Lamba and Abhishek and Jayaprakash Akula and Rishabh Dabral and Preethi Jyothi and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2104.04598},
  year   = {2021}
}

备注

Work accepted at Interspeech 2021