中文

RAVEN:面向音频、视频、嵌入式传感器与自然语言问答的查询引导表示对齐

计算与语言 2025-09-08 v3 计算机视觉与模式识别 机器学习 多媒体

摘要

多模态问答通常需要识别哪些视频、音频或传感器标记与问题相关。然而,模态间 disagreement 常见:镜头外言语、背景噪声或视野外运动常误导赋予所有流均等权重的融合模型。我们提出了RAVEN,一个统一的问答架构,其核心是QuART(query-conditioned cross-modal gating)模块,为每个标记在各模态中的相关性分配标量得分,使模型在融合前放大有用信号并抑制干扰源。RAVEN通过三阶段管道进行训练,包括单模态预训练、查询对齐融合和disagreement导向的微调——每个阶段针对多模态推理中的不同挑战:表示质量、跨模态相关性和对模态不匹配的鲁棒性。为支持训练与评估,我们发布了AVS-QA数据集,包含30万同步的Audio--Video-Sensor流量配以自动生成的问答对。实验结果表明,在包括内源性和外源性任务在内的七个多模态问答基准测试上,RAVEN相较于最先进的多模态大语言模型实现了最高达14.5%和8.0%的准确率提升。纳入传感器数据可提供额外的16.4%提升,该模型在模态损坏情况下仍表现出色,相较于SOTA基线实现了50.23%的优势。我们的代码和数据集已在https://github.com/BASHLab/RAVEN 上发布。

关键词

引用

@article{arxiv.2505.17114,
  title  = {RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language},
  author = {Subrata Biswas and Mohammad Nur Hossain Khan and Bashima Islam},
  journal= {arXiv preprint arXiv:2505.17114},
  year   = {2025}
}