探索LLM基于扰动的评估鲁棒性
计算与语言
2024-12-13 v1 人工智能
摘要
传统评估指标如BLEU和ROUGE在捕捉生成文本的细微质量方面不足,尤其当没有单一真实答案时。本文探讨了大型语言模型(LLM), Specifically Google Gemini 1,作为非标准化指标的自动评估器的潜力。我们在摘要和基于对话的任务上进行实验,检验不同的提示策略,比较LLM在SummEval和USR数据集上的质量评估效果,要求模型生成评分及其依据。此外,我们通过使用扰动输入来探索LLM评估器的鲁棒性。我们的发现表明,尽管LLM有前景,但其与人类评估器的对齐程度有限,对扰动不够稳健,需要显著改进才能作为主观指标的可靠独立评估器。
引用
@article{arxiv.2412.09269,
title = {Towards Understanding the Robustness of LLM-based Evaluations under Perturbations},
author = {Manav Chaudhary and Harshit Gupta and Savita Bhat and Vasudeva Varma},
journal= {arXiv preprint arXiv:2412.09269},
year = {2024}
}
备注
Accepted at ICON 2024