中文

面向弱监督音视频视频解析的联合模态标签去噪

计算机视觉与模式识别 2022-08-02 v4

摘要

本文关注弱监督音视频视频解析任务,旨在识别各模态所属的全部事件并定位其时间边界。该任务具有挑战性,因为训练仅提供指示视频事件的整体标签。然而,某一事件可能被标注却未出现在某一模态中,这导致了特定模态的噪声标签问题。本工作中,我们提出一种训练策略以动态识别并去除特定模态的噪声标签。其动机源于两个关键观察:1)网络倾向于先学习干净样本;2)被标注的事件至少会出现在一个模态中。具体而言,我们在每个模态内对各迷你批次中所有样本的损失分别排序,并根据模态内与模态间损失之间的关系筛选噪声样本。此外,我们还提出一种简单而有效的噪声比例估计方法,通过计算置信度低于预设阈值的样本占比实现。我们的方法相较先前最优方法取得大幅提升(例如段落级视觉指标从60.0%提升至63.8%),证明了方法的有效性。代码与训练模型公开于 \url{https://github.com/MCG-NJU/JoMoLD}。

关键词

引用

@article{arxiv.2204.11573,
  title  = {Joint-Modal Label Denoising for Weakly-Supervised Audio-Visual Video Parsing},
  author = {Haoyue Cheng and Zhaoyang Liu and Hang Zhou and Chen Qian and Wayne Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2204.11573},
  year   = {2022}
}

备注

Accepted by ECCV 2022