检索以恢复: 通过语义一致性净化实现不完整音视频问答
计算机视觉与模式识别
2026-04-15 v2
摘要
最近的音视频问答方法取得了显著进展。然而,大多数音视频问答方法缺乏处理缺失模态的有效机制,在数据中断的真实场景中性能严重下降。此外,当前处理缺失模态的主流方法主要依赖生成式插补来合成缺失特征。这些方法虽然部分有效,但倾向于捕捉模态间的共性,而难以获取缺失数据中独特的、模态特定的知识,导致幻觉和推理准确性受损。为应对这些挑战,我们提出了R²ScP,一个新颖的框架,将缺失模态处理的范式从传统的生成式插补转变为基于检索的恢复。具体来说,我们利用通过统一语义嵌入的跨模态检索来获取缺失的领域特定知识。为了最大化语义恢复,我们引入了一种上下文感知的自适应净化机制,以消除检索数据中的潜在语义噪声。此外,我们采用两阶段训练策略来显式建模来自不同来源的知识之间的语义关系。大量实验表明,R²ScP显著改善了音视频问答,并增强了在模态不完整场景下的鲁棒性。
引用
@article{arxiv.2604.10695,
title = {Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification},
author = {Jiayu Zhang and Shuo Ye and Qilang Ye and Zihan Song and Jiajian Huang and Zitong Yu},
journal= {arXiv preprint arXiv:2604.10695},
year = {2026}
}
备注
Accepted by ACL 2026 Main Conference