中文

基于音频源定位引导 Mixup 的半监督视听视频动作识别

计算机视觉与模式识别 2025-03-05 v1 人工智能

摘要

视频动作识别是理解和发现视频内容的一项具有挑战性但重要的任务。然而,获取视频标注成本高昂,因此在该任务中研究了半监督学习(SSL),以期在少量标注数据下仍能提升性能。先前关于半监督视频动作识别的研究大多集中于使用单一模态——视觉,但视频是多模态的,因此同时利用视觉和音频将是理想的选择并能进一步提升性能,而这一点尚未得到充分探索。为此,我们提出了用于视频动作识别的视听 SSL,即使在标注数据极少且具挑战性的情况下,也能同时使用视觉和音频。此外,为了最大化音频和视频的信息,我们提出了一种新颖的音频源定位引导 mixup 方法,该方法考虑了视频与音频模态之间的跨模态关系。在 UCF-51、Kinetics-400 和 VGGSound 数据集上的实验表明,我们的模型展示了所提出的半监督视听动作识别框架及音频源定位引导 mixup 的优越性能。

关键词

引用

@article{arxiv.2503.02284,
  title  = {Semi-Supervised Audio-Visual Video Action Recognition with Audio Source Localization Guided Mixup},
  author = {Seokun Kang and Taehwan Kim},
  journal= {arXiv preprint arXiv:2503.02284},
  year   = {2025}
}