中文

实现开放域对话系统可靠的人类评估

计算与语言 2022-03-14 v1

摘要

开放域对话系统的评估极具挑战性,且人们反复强调亟需开发更好的技术。尽管近期竞赛中做出了大量努力以开展可靠的系统在线评估,但标注工作已被放弃,并被报道为过于不可靠而无法产生合理结果。这是一个严重的问题,因为自动指标并不被认为能良好指示何为高质量对话。为回应竞赛关于对话评估中迫切 needing 更好评估技术的求救呼吁,我们提出了一种高度可靠且仍可行、低成本的人类评估的成功开发。自我复制实验显示出几乎完全可重复的结果,相关系数为r=0.969r=0.969。此外,由于缺乏适当的统计显著性检验方法,对话评估中很少考虑系统潜在改进由偶然因素导致的可能性,而我们提出的评估便于标准检验的应用。由于我们开发了高度可靠的评估方法,可揭示关于系统性能的新见解。因此我们包含了最先进模型的比较:(i)带与不带人物角色,以衡量人物角色对对话质量的贡献;以及(ii)规定主题与自由选定主题。有趣的是关于人物角色,结果表明人物角色并未如预期般对对话质量产生正向贡献。

关键词

引用

@article{arxiv.2203.05899,
  title  = {Achieving Reliable Human Assessment of Open-Domain Dialogue Systems},
  author = {Tianbo Ji and Yvette Graham and Gareth J. F. Jones and Chenyang Lyu and Qun Liu},
  journal= {arXiv preprint arXiv:2203.05899},
  year   = {2022}
}

备注

to appear at ACL 2022 main conference