中文

Soda-Eval:大语言模型时代的开放域对话评估

计算与语言 2024-10-07 v3

摘要

尽管人工评估仍是开放域对话评估的金标准,但使用大语言模型(LLM)进行自动评估的日益普及也已扩展到对话领域。然而,大多数评估基准所依赖的测试集主要针对流畅性和相关性等维度,这些维度无法反映当代模型所面临的挑战。事实上,对Soda(一个由GPT-3.5生成的对话数据集)的定性分析表明,当前的聊天机器人可能表现出一些与连贯性和常识知识相关的反复出现的问题,尽管它们通常能生成高度流畅且相关的回复。鉴于上述局限性,本文介绍了Soda-Eval,一个基于Soda的带标注数据集,包含超过12万条回合级评估,覆盖1万段对话,标注由GPT-4生成。利用Soda-Eval作为基准,我们研究了多个经过指令微调的开源LLM的性能,发现对话评估仍然具有挑战性。对这些模型进行微调可以在相关性和解释性方面优于少样本推理。

关键词

引用

@article{arxiv.2408.10902,
  title  = {Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMs},
  author = {John Mendonça and Isabel Trancoso and Alon Lavie},
  journal= {arXiv preprint arXiv:2408.10902},
  year   = {2024}
}

备注

Accepted to EMNLP2024 (findings)