用于弱监督主动说话人定位的跨模态视频表示
计算机视觉与模式识别
2022-12-26 v2 多媒体
摘要
对媒体刻画(如电影和电视中某人在屏幕上被听到和看到的程度的包容性刻画)的客观理解,要求机器自动辨别谁、何时、如何以及在何处说话或不说话。说话人活动可从媒体内容中丰富的多模态信息自动辨别。然而,由于媒体内容的巨大多样性和语境可变性以及标注数据的缺乏,这是一个具有挑战性的问题。在本工作中,我们提出一种跨模态神经网络用于学习视觉表示,其隐含了关于视觉帧中说话人空间位置的信息。为避免对视觉帧中主动说话人进行昂贵的人工标注,我们提出一种用于电影内容中主动说话人定位任务的弱监督系统。我们利用学到的跨模态视觉表示,并以电影字幕作为语音活动的代理提供弱监督,从而无需人工标注。我们在 AVA 主动说话人数据集上评估了所提系统的性能,并证明了跨模态嵌入相对于全监督系统在定位主动说话人方面的有效性。我们还展示了在音视觉框架下语音活动检测任务的当前最优性能,尤其在语音伴随噪声和音乐时。
引用
@article{arxiv.2003.04358,
title = {Cross modal video representations for weakly supervised active speaker localization},
author = {Rahul Sharma and Krishna Somandepalli and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2003.04358},
year = {2022}
}