用于音视频视频解析的跨模态学习
声音
2021-06-22 v2 计算机视觉与模式识别
机器学习
音频与语音处理
图像与视频处理
摘要
本文提出一种用于音视频视频解析(AVVP)任务的新方法,该任务将视频中的事件针对音频和视觉模态分别划分。所提出的解析方法同时检测此类事件的起止时间边界。我们展示了 AVVP 如何受益于以下旨在有效跨模态学习的技术:(i)对抗训练与跳跃连接;(ii)全局上下文感知注意力;以及(iii)使用音视频定位目标进行自监督预训练以获得跨模态音视频表示。我们在 Look, Listen, and Parse(LLP)数据集上给出了大量实验评估,表明我们在 AVVP 所提出的全部五项指标上均优于最先进的混合注意力网络(HAN)。我们还给出了若干消融实验以验证预训练、全局注意力和对抗训练的作用。
引用
@article{arxiv.2104.04598,
title = {Cross-Modal learning for Audio-Visual Video Parsing},
author = {Jatin Lamba and Abhishek and Jayaprakash Akula and Rishabh Dabral and Preethi Jyothi and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2104.04598},
year = {2021}
}
备注
Work accepted at Interspeech 2021