中文

FATHOMS-RAG:用于评估多模态系统中思考与观察的框架

人工智能 2026-05-25 v3

摘要

检索增强生成(RAG)已成为提高大型语言模型(LLM)事实准确性的有前景的范例。我们引入了一个基准测试,旨在整体评估RAG管道,评估其在信息摄取、检索和推理等多个模态方面的能力,这与现有聚焦于检索等特定方面的基准测试不同。我们提出(1)一个由人工创建的93个问题的数据集,用于评估管道在单一或多个文档中处理文本、表格、图像和跨模态数据的能力;(2)一种基于短语的召回度指标,用于衡量正确性;(3)一种最近邻嵌入分类器,用于识别潜在的管道幻觉;(4)对2个使用开源检索机制构建的管道和4个闭源基础模型的比较评估;(5)对我们正确性和幻觉指标对齐性的第三方人类评估。我们发现,闭源管道在正确性和幻觉指标上均显著优于开源管道,特别是在依赖多模态和跨文档信息的问题上表现差距更大。我们对指标的人类评估显示,在1-5李克特量表上(5表示“strongly agree”),正确性和幻觉检测的平均一致性分别为4.62和4.53。

关键词

引用

@article{arxiv.2510.08945,
  title  = {FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation},
  author = {Samuel Hildebrand and Curtis Taylor and Sean Oesch and James M Ghawaly and Amir Sadovnik and Ryan Shivers and Brandon Schreiber and Kevin Kurian},
  journal= {arXiv preprint arXiv:2510.08945},
  year   = {2026}
}

备注

Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG