电信领域问答中RAG评估指标的评价
计算与语言
2024-07-23 v1 人工智能
信息检索
机器学习
摘要
检索增强生成(RAG)被广泛用于使大型语言模型(LLMs)在各个领域执行问答(QA)任务。然而,基于开源LLM的RAG在专业领域中面临生成响应评估的挑战。文献中一个流行的框架是RAG评估(RAGAS),这是一个公开可用的库,使用LLMs进行评估。RAGAS的一个缺点是其评估指标数值的推导细节缺失。本工作的成果之一是针对少数指标(忠实度、上下文相关性、答案相关性、答案正确性、答案相似性和事实正确性)修改了该包,通过使用任意LLMs提供提示的中间输出。接着,我们分析了专家对修改后RAGAS包输出的评估,并观察了在电信领域使用它的挑战。我们还研究了在正确检索与错误检索下指标的效果,并观察到少数指标在正确检索时具有更高的值。我们还研究了基础嵌入与通过预训练和微调进行领域适应的嵌入之间指标的差异。最后,我们评论了将这些指标用于真实电信QA任务的适用性和挑战。
引用
@article{arxiv.2407.12873,
title = {Evaluation of RAG Metrics for Question Answering in the Telecom Domain},
author = {Sujoy Roychowdhury and Sumit Soman and H G Ranjani and Neeraj Gunda and Vansh Chhabra and Sai Krishna Bala},
journal= {arXiv preprint arXiv:2407.12873},
year = {2024}
}
备注
Accepted for publication in ICML 2024 Workshop on Foundation Models in the Wild