THELMA:基于任务的大型语言模型应用-检索增强生成问答全面评估
计算与语言
2025-06-05 v2 人工智能
摘要
我们提出THELMA(Task Based Holistic Evaluation of Large Language Model Applications),一个无参考框架,用于RAG(检索增强生成)基于问答(QA)应用的评估。THELMA包括六个相互关联的度量标准,专为全面、细粒度评估RAG QA应用而设计。THELMA框架帮助开发人员和应用所有者在不要求标记来源或参考响应的情况下评估、监控和改进端到端RAG QA管道。我们还介绍了THELMA度量之间相互作用的发现,这些发现可以解释以识别QA应用中需要改进的特定RAG组件。
引用
@article{arxiv.2505.11626,
title = {THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering},
author = {Udita Patel and Rutu Mulkar and Jay Roberts and Cibi Chakravarthy Senthilkumar and Sujay Gandhi and Xiaofei Zheng and Naumaan Nayyar and Parul Kalra and Rafael Castrillo},
journal= {arXiv preprint arXiv:2505.11626},
year = {2025}
}
备注
Added author