ER-RAG:基于ER模型的异构数据源增强RAG
信息检索
2025-04-10 v1 人工智能
计算与语言
摘要
大语言模型(LLM)在问答(QA)任务中表现出色,检索增强生成(RAG)通过整合来自各种来源(如网页、数据库和知识图谱)的外部证据来提升其精度。然而,当前RAG方法依赖于针对 individual 数据源的代理特定策略,这在低资源或黑箱环境中提出了挑战,并且当证据跨越多个来源时会使操作复杂化。为解决这些限制,我们提出ER-RAG,一个通过实体-关系(ER)模型统一跨异构数据源的证据整合的框架。ER-RAG通过ER-based API的GET和JOIN操作标准化实体检索和关系查询。它采用两阶段生成过程:首先,偏好优化模块选择最佳数据源;其次,另一个模块根据数据源模式构建API链。这一统一方法允许在 diverse 数据源上进行高效微调和无缝集成。ER-RAG通过在2024年KDDCup CRAG挑战中赢得所有三个轨道,实现了与采用8B LLM底层的商业RAG管道相当的性能。它比混合竞争者在LLM评分上提高了3.1%,检索速度提高了5.5倍。
引用
@article{arxiv.2504.06271,
title = {ER-RAG: Enhance RAG with ER-Based Unified Modeling of Heterogeneous Data Sources},
author = {Yikuan Xia and Jiazun Chen and Yirui Zhan and Suifeng Zhao and Weipeng Jiang and Chaorui Zhang and Wei Han and Bo Bai and Jun Gao},
journal= {arXiv preprint arXiv:2504.06271},
year = {2025}
}