多媒体感知问答:检索与跨模态推理架构综述
信息检索
2025-10-24 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
问答(QA)系统传统上依赖结构化文本数据,但快速增长的多媒体内容(图像、音频、视频和结构化元数据)为检索增强型问答带来了新挑战和机遇。本文对近期发展于集成多媒体检索管道的QA系统进行综述,聚焦于对齐视觉、语言和音频模态与用户查询的检索架构。我们根据检索方法、融合技术和答案生成策略对方法进行分类,并分析基准数据集、评估协议及性能权衡。进一步地,我们突出关键挑战,如跨模态对齐、延迟-精度权衡以及语义 grounding,并概述面向构建更稳健和情境感知QA系统的开放问题和未来研究方向,侧重于利用多媒体数据。
引用
@article{arxiv.2510.20193,
title = {Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures},
author = {Rahul Raja and Arpita Vats},
journal= {arXiv preprint arXiv:2510.20193},
year = {2025}
}
备注
In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393