中文

从语言视角重访弱监督音视觉视频解析

计算机视觉与模式识别 2023-10-31 v6

摘要

我们关注弱监督音视觉视频解析任务(AVVP),其旨在识别并定位音频/视觉模态中的所有事件。先前的工作仅集中于跨模态的视频级整体标签去噪,而忽略了段级标签噪声,其中相邻的视频段(即1秒视频片段)可能包含不同的事件。然而,识别段中的事件具有挑战性,因为其标签可能是视频中发生的事件的任意组合。为解决此问题,我们考虑从语言视角处理AVVP,因为语言可以不受固定标签限制地自由描述各段中各种事件的出现方式。具体而言,我们设计语言提示来描述每个视频中事件出现的所有情况。然后,计算语言提示与视频段之间的相似度,将最相似提示所对应的事件视为段级标签。此外,为处理错误标注的段,我们提出对不可靠段进行动态重加权以调整其标签。实验表明,我们这种简单而有效的方法大幅优于最先进的方法。

关键词

引用

@article{arxiv.2306.00595,
  title  = {Revisit Weakly-Supervised Audio-Visual Video Parsing from the Language Perspective},
  author = {Yingying Fan and Yu Wu and Bo Du and Yutian Lin},
  journal= {arXiv preprint arXiv:2306.00595},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023