迈向聊天机器人人工评估的标准准则:一项综述
计算与语言
2021-05-25 v1
摘要
人工评估正成为测试聊天机器人性能的必要手段。然而,现有通用设置存在严重的可靠性与可复现问题,部分原因在于准则的极度多样性。当务之急是提出标准准则与精确定义。为此,我们对涉及聊天机器人人工评估的105篇论文进行了深入调研。基于此,我们提出了五项标准准则及精确定义。
引用
@article{arxiv.2105.11197,
title = {Towards Standard Criteria for human evaluation of Chatbots: A Survey},
author = {Hongru Liang and Huaqing Li},
journal= {arXiv preprint arXiv:2105.11197},
year = {2021}
}