中文

教师引导的伪监督与跨模态对齐用于音视频视频解析

计算机视觉与模式识别 2025-09-18 v1 多媒体

摘要

弱监督音视频视频解析(Audio-Visual Video Parsing, AVVP)旨在检测可听见的、可见的以及音视频事件,而无需时间标注。以往工作强调通过对比学习或协作学习来细化全局预测,但忽略了稳定的段级监督和类别感知的跨模态对齐。为此,我们提出了两种策略:(1)基于指数移动平均(EMA)的伪监督框架,通过自适应阈值或 top-k 选择生成可靠的段级掩码,提供超出视频级标签的稳定时间指导;以及(2)类别感知的跨模态一致性(Class-aware Cross-modal Agreement, CMA)损失,在可靠的段-类别对上对齐音视频嵌入,确保跨模态一致性的同时保留时间结构。在 LLP 和 UnAV-100 数据集上的评估显示,我们的方法在多个指标上实现了最新水平(state-of-the-art, SOTA)性能。

关键词

引用

@article{arxiv.2509.14097,
  title  = {Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing},
  author = {Yaru Chen and Ruohao Guo and Liting Gao and Yang Xiang and Qingyu Luo and Zhenbo Li and Wenwu Wang},
  journal= {arXiv preprint arXiv:2509.14097},
  year   = {2025}
}