SAGEval:基于满意智能体的无参考开放式文本自然语言生成评估的前沿
计算与语言
2024-11-26 v1 多智能体系统
摘要
大型语言模型(LLM)集成到Microsoft 365套件和Google Workspace等应用中,用于创建/处理文档、电子邮件、演示文稿等,已显著提高了生产力和节省了时间。然而,随着这些集成变得越来越复杂,确保LLM集成应用输出的质量相关且适合使用至关重要。认识到需要开发稳健的自然语言生成评估方法,特别是在不存在或不充分提供参考标签的情况下,本文介绍了一个新颖的框架“SAGEval”,它利用一个批评智能体来反馈LLM评估器生成的分数。我们表明,在缺乏参考标签的情况下,批评智能体能够纠正LLM评估器的分数,从而减少对标记数据的需求,即使是在复杂的自然语言生成评估场景中,例如生成JSON结构的表单/调查问卷,其中包含多种响应类型,如多项选择、李克特量表、单项选择等。
关键词
引用
@article{arxiv.2411.16077,
title = {SAGEval: The frontiers of Satisfactory Agent based NLG Evaluation for reference-free open-ended text},
author = {Reshmi Ghosh and Tianyi Yao and Lizzy Chen and Sadid Hasan and Tianwei Chen and Dario Bernal and Huitian Jiao and H M Sajjad Hossain},
journal= {arXiv preprint arXiv:2411.16077},
year = {2024}
}