中文

迈向聊天机器人人工评估的标准准则:一项综述

计算与语言 2021-05-25 v1

摘要

人工评估正成为测试聊天机器人性能的必要手段。然而,现有通用设置存在严重的可靠性与可复现问题,部分原因在于准则的极度多样性。当务之急是提出标准准则与精确定义。为此,我们对涉及聊天机器人人工评估的105篇论文进行了深入调研。基于此,我们提出了五项标准准则及精确定义。

关键词

引用

@article{arxiv.2105.11197,
  title  = {Towards Standard Criteria for human evaluation of Chatbots: A Survey},
  author = {Hongru Liang and Huaqing Li},
  journal= {arXiv preprint arXiv:2105.11197},
  year   = {2021}
}