面向 Web 问答的多模态多跳源检索
计算与语言
2025-01-09 v1 人工智能
摘要
本工作致力于解决多模态多跳问答(Multi-modal Multi-hop Question Answering)中的学习与推理挑战。我们提出一种基于句子语义结构的图推理网络,用于学习多源推理路径,并在图像与文本模态之间寻找答案所需的支撑事实。本文聚焦于 WebQA 数据集,构建了一个强大的基线模型,通过成对分类任务查找相关来源。我们证明,在正确利用预训练模型的特征表示后,图结构有助于提高多模态多跳问答性能。我们指出,图结构和邻接矩阵都是与任务相关的先验知识,图结构可被利用以提升该任务的检索性能。实验及可视化分析表明,图网络上的消息传递或整个图结构可取代大规模多模态变换器中的 token 级交叉注意力。我们展示了该方法的适用性,并以相较于变换器基线模型的 **4.6%** 检索 F1 分数的性能提升,证明即使是非常轻量级的模型也能取得显著效果。我们进一步证明了该模型在大规模检索场景中的适用性。
引用
@article{arxiv.2501.04173,
title = {Multimodal Multihop Source Retrieval for Web Question Answering},
author = {Navya Yarrabelly and Saloni Mittal},
journal= {arXiv preprint arXiv:2501.04173},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2010.03604 by other authors