面向音频 - 视觉问答的对象感知自适应正样本学习
计算机视觉与模式识别
2023-12-21 v1
摘要
本文聚焦于音频 - 视觉问答(AVQA)任务,该任务旨在回答源自未剪辑可听视频的问题。为了生成准确的答案,AVQA 模型需要找到与给定问题最相关的信息丰富的音频 - 视觉线索。在本文中,我们提出显式考虑视频帧中的细粒度视觉物体(物体级线索),并从特征交互和模型优化的角度探索多模态关系(即物体、音频和问题)。对于前者,我们提出了一种端到端的面向对象网络,该网络采用问题条件的线索发现模块,使音频/视觉模态集中于问题的各自关键词,并设计了一个模态条件的线索收集模块,以突出密切相关的音频片段或视觉物体。对于模型优化,我们提出了一种对象感知的自适应正样本学习策略,选择高度语义匹配的多模态对作为正样本。具体而言,我们设计了两个对象感知的对比损失函数,分别用于识别高度相关的问题 - 物体对和音频 - 物体对。这些被选中的对被迫具有比不匹配对更大的相似度值。正样本选择过程是自适应的,因为每个视频帧中选择的正样本对可能不同。这两个对象感知目标有助于模型理解哪些物体确实与问题相关,以及哪些物体正在发出声音。在 MUSIC-AVQA 数据集上的大量实验表明,所提方法在寻找有利的音频 - 视觉线索方面是有效的,并实现了新的最先进(state-of-the-art)问答性能。
引用
@article{arxiv.2312.12816,
title = {Object-aware Adaptive-Positivity Learning for Audio-Visual Question Answering},
author = {Zhangbin Li and Dan Guo and Jinxing Zhou and Jing Zhang and Meng Wang},
journal= {arXiv preprint arXiv:2312.12816},
year = {2023}
}
备注
Accepted by AAAI-2024