中文

BRIT:统一图像-文本图上的双向检索

计算与语言 2025-09-30 v2

摘要

检索增强生成(RAG)已成为一种有前景的技术,用于增强大型语言模型生成回答的质量和相关性。虽然最近的进展主要集中在改进基于文本查询的RAG,但尚未充分探索包含文本和图像的多模态文档上的RAG。尤其是在微调不起作用的情况下。本文提出了BRIT,一种新型的多模态RAG框架,有效地将文档中各种文本-图像连接统一为多模态图,并检索文本和图像作为查询特定的子图。通过在图中遍历图像到文本和文本到图像的路径,BRIT不仅检索直接与查询相关的图像和文本,还进一步检索与回答复杂跨模态多跳问题相关的内容。为了评估BRIT的有效性,我们引入了专门针对需要理解文本-图像关系的多模态问答任务而设计的MM-RAG测试集。我们的综合实验展示了BRIT的优越性,突出了其处理多模态文档上跨模态问题的能力。

关键词

引用

@article{arxiv.2505.18450,
  title  = {BRIT: Bidirectional Retrieval over Unified Image-Text Graph},
  author = {Ainulla Khan and Yamada Moyuru and Srinidhi Akella},
  journal= {arXiv preprint arXiv:2505.18450},
  year   = {2025}
}

备注

Accepted in EMNLP-2025 Findings