评估你无法评估之物:生成回复的不可评测质量
计算与语言
2024-05-07 v3
摘要
ChatGPT等大型语言模型(LLM)已展现出卓越的语言理解与生成能力。尽管基于LLM的无参考评估器比传统基于参考的评估器具有更好的人类一致性,但在使用基于LLM的无参考评估器时仍存在诸多挑战。无参考评估器更适用于具有不同语义回复的开放式样例,但并非所有样例均为开放式。对于具有唯一正确语义回复的封闭式样例,当给出与事实及参考语义不一致的回复时,无参考评估器仍会认为其质量高。为全面评估基于LLM的评估器的可靠性,我们分别基于KdConv和DSTC7-AVSD构建了两个对抗性元评估对话生成数据集KdConv-ADV与DSTC7-ADV。相较先前元评估基准,KdConv-ADV与DSTC7-ADV更具挑战性,因其要求评估器能借助外部知识甚至自身知识对封闭式样例作出合理评估。实证结果表明,LLM识别不合理回复的能力不足,使用基于LLM的无参考评估器评估对话回复质量存在风险。
引用
@article{arxiv.2305.14658,
title = {Evaluate What You Can't Evaluate: Unassessable Quality for Generated Response},
author = {Yongkang Liu and Shi Feng and Daling Wang and Yifei Zhang and Hinrich Schütze},
journal= {arXiv preprint arXiv:2305.14658},
year = {2024}
}
备注
preprint