基于多尺度类别感知时序图的文本丰富音视频视频解析
计算机视觉与模式识别
2025-10-28 v2 多媒体
摘要
音视频视频解析 (AVVP) 旨在检测视频中的事件类别及其时序边界,通常在弱监督条件下完成。现有方法主要关注 (i) 使用基于注意力的体系结构改进时序建模,或 (ii) 生成更丰富的伪标签以解决缺乏帧级标注的问题。然而,基于注意力的模型容易对噪声伪标签过拟合,导致累积性训练误差,而伪标签生成方法则在帧上均匀分配注意力,削弱了时序局部化精度。为解决这些挑战,我们提出了 TEn-CATG,一个结合语义校准与类别感知时序推理的文本丰富AVVP框架。具体而言,我们设计了一个双向文本融合 (BiT) 模块,利用音视频特征作为语义锚点来细化文本嵌入,这不同于传统的文本到特征对齐方式,从而减轻噪声并增强跨模态一致性。此外,我们引入类别感知时序图 (CATG) 模块,通过选择多尺度时序邻居并学习类别特定的时序衰减因子,实现对事件依赖时序推理。广泛的实验表明,TEn-CATG 在基准数据集 LLP 和 UnAV-100 上的多个评估指标上实现了最先进的结果,凸显了其鲁棒性和在弱监督AVVP任务中捕捉复杂时序和语义依赖性的卓越能力。
引用
@article{arxiv.2509.04086,
title = {TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph},
author = {Yaru Chen and Faegheh Sardari and Peiliang Zhang and Ruohao Guo and Yang Xiang and Zhenbo Li and Wenwu Wang},
journal= {arXiv preprint arXiv:2509.04086},
year = {2025}
}