用于弱监督音视事件定位的时间标签精炼
计算机视觉与模式识别
2023-07-20 v2 机器学习
声音
音频与语音处理
摘要
音视事件定位(AVEL)是 temporally 定位并分类"音视事件"的任务,即视频中同时可见且可听的事件。本文在弱监督设定下解决 AVEL,其中仅提供视频级事件标签(其存在/缺失,而非其在时间上的位置)作为训练监督。我们的思路是使用一个基础模型以比视频级更细的时间分辨率在训练数据上估计标签,并用这些标签重新训练模型。即,我们通过以下方式确定训练视频中每个帧"切片"的标签子集:(i) 将该切片之外的帧替换为来自另一视频级标签无重叠的第二视频的帧;(ii) 将此合成视频输入基础模型以提取仅该切片的标签。为处理合成视频的分布外性质,我们为基础模型提出一个辅助目标,以诱导出如期望的更可靠的局部化事件标签预测。我们的三阶段流水线无需架构改动即优于多种现有 AVEL 方法,并提升了相关弱监督任务的性能。
引用
@article{arxiv.2307.06385,
title = {Temporal Label-Refinement for Weakly-Supervised Audio-Visual Event Localization},
author = {Kalyan Ramakrishnan},
journal= {arXiv preprint arXiv:2307.06385},
year = {2023}
}