中文

强化标签去噪用于弱监督音视频视频解析

计算机视觉与模式识别 2024-12-30 v1

摘要

音视频视频解析(AVVP)旨在识别具有精确时间边界的音频和视觉事件标签,这在音频或视觉模态仅包含一个事件标签且仅有整体视频标签可用时颇具挑战性。现有的标签去噪模型常将去噪过程视为独立的预处理步骤,导致标签去噪与AVVP任务之间存在断层。为弥合这一差距,我们提出了一种基于联合强化学习的新型标签去噪方法(RLLD)。该方法通过联合优化策略实现标签去噪与视频解析模型的同步训练。我们引入一种新的AVVP验证和软间奖励反馈机制,直接指导标签去噪策略的学习。广泛的AVVP任务实验表明,我们提出的方法在性能上优于标签去噪技术。此外,通过将我们的标签去噪方法整合到其他AVVP模型中,我们发现它可以进一步提升解析结果。

关键词

引用

@article{arxiv.2412.19563,
  title  = {Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing},
  author = {Yongbiao Gao and Xiangcheng Sun and Guohua Lv and Deng Yu and Sijiu Niu},
  journal= {arXiv preprint arXiv:2412.19563},
  year   = {2024}
}