GRAMMAR:面向闭合域检索增强型语言模型的基于 grounding 与模块化的评估方法
计算与语言
2024-10-24 v7 人工智能
摘要
检索增强生成(RAG)系统在各行各业广泛用于查询闭合域和内部知识库,但由于闭合域数据的私有性以及稀缺的带有可验证真实答案的查询,评估这些系统 presents 重大挑战。此外,缺乏分析方法来诊断有问题的模块并识别由知识缺乏或鲁棒性问题等引起的失败类型。为此,我们引入GRAMMAR(GRounded And Modular Methodology for Assessment of RAG),一种包含基于 grounding 数据生成过程和有效定位有缺陷模块的评估协议的评估框架。我们的验证实验表明,GRAMMAR提供了一种可靠的方法,用于识别易受攻击的模块,并支持对文本形式漏洞进行假设检验。我们在 GitHub 仓库(见 https://github.com/xinzhel/grammar)中提供了一个开源工具,方便复现我们的实验结果,enable 在闭合域环境中进行可靠且模块化的评估。
引用
@article{arxiv.2404.19232,
title = {GRAMMAR: Grounded and Modular Methodology for Assessment of Closed-Domain Retrieval-Augmented Language Model},
author = {Xinzhe Li and Ming Liu and Shang Gao},
journal= {arXiv preprint arXiv:2404.19232},
year = {2024}
}
备注
Under Review