沿音视事件线传播正样本
计算机视觉与模式识别
2021-04-06 v2 多媒体
声音
音频与语音处理
摘要
视觉与音频信号在自然环境中常共存,形成音视事件(AVEs)。给定一段视频,我们旨在定位包含 AVE 的视频片段并识别其类别。为学习分类器的判别性特征,关键在于识别有用(即正)的音视片段对,并滤除无关片段,无论它们是否同步。为此,我们提出一种新的正样本传播(PSP)模块,通过评估每对可能片段间的关系来发现并利用紧密相关的音视对。这可通过构建每个音频与视觉片段间的全配对相似度图,并仅聚合高相似度得分片段对的特征来实现。为促使网络为正样本提取高相关特征,我们提出一种新的音视对相似度损失。我们还提出一个新的加权分支,以在弱监督设定下更好地利用时间相关性。我们在公开 AVE 数据集上进行了大量实验,在 fully 与弱监督设定下均取得了新的 SOTA 精度,从而验证了方法的有效性。
引用
@article{arxiv.2104.00239,
title = {Positive Sample Propagation along the Audio-Visual Event Line},
author = {Jinxing Zhou and Liang Zheng and Yiran Zhong and Shijie Hao and Meng Wang},
journal= {arXiv preprint arXiv:2104.00239},
year = {2021}
}
备注
Accepted to CVPR 2021. Code is available at https://github.com/jasongief/PSP_CVPR_2021