中文

一种面向生成式对话系统的评估协议

计算与语言 2020-10-27 v1

摘要

面向开放域对话系统涌现了大量新颖的生成模型;然而,对不同系统尚缺乏系统性评估。系统性比较需要在实验设计、评估集、对话系统及其输出以及统计分析上保持一致。我们提出一种利用头对头成对比较评估对话模型的协议。我们基于五个评估数据集上的成对头对头表现(胜-负-平),使用 Bradley-Terry 模型和 TrueSkill 排序方法分析了十个声称达到最先进性能的近期模型。我们的结果表明,DialoGPT 和 Blender 是更优的系统。这些发现证明了我们的协议用于评估对话智能体与评估集的可行性。最后,我们公开所有代码与评估结果,供研究者将其模型与其他最先进对话模型进行比较。

关键词

引用

@article{arxiv.2010.12741,
  title  = {An Evaluation Protocol for Generative Conversational Systems},
  author = {Seolhwa Lee and Heuiseok Lim and João Sedoc},
  journal= {arXiv preprint arXiv:2010.12741},
  year   = {2020}
}