中文

LINK:面向音视频视频解析的自适应模态交互

计算机视觉与模式识别 2025-01-03 v2

摘要

音视频视频解析旨在通过弱标签对视频进行分类,同时将事件识别为可见、可听或两者兼具,并确定其相应的时间边界。许多方法忽略了不同模态之间常常缺乏对齐这一事实,从而在模态交互过程中引入了额外噪声。在本工作中,我们提出了一种面向非对齐知识的交互学习方法(Learning Interaction method for Non-aligned Knowledge, LINK),旨在通过在事件预测过程中动态调整各模态的输入来平衡不同模态的贡献。此外,我们利用伪标签的语义信息作为先验知识,以缓解来自其他模态的噪声。实验结果表明,我们的模型在 LLP 数据集上优于现有方法。

关键词

引用

@article{arxiv.2412.20872,
  title  = {LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing},
  author = {Langyu Wang and Bingke Zhu and Yingying Chen and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2412.20872},
  year   = {2025}
}

备注

Accepted by ICASSP 2025