与开放域聊天机器人的对话究竟有多“开放”?一种基于言语事件的评估方案
计算与语言
2022-11-28 v1
摘要
开放域聊天机器人理应不受话题、任务或领域限制地与人自由对话。然而,开放域对话的边界和/或内容并不清晰。为厘清“开放性”的边界,我们开展了两项研究:首先,我们对某聊天机器人评估数据集(即 Google 的 Meena)中出现的“言语事件”类型进行分类,发现这些对话主要涵盖“闲聊”类别,而排除了真实人际交流中遇到的其他言语事件类别。其次,我们进行了一项小规模试点研究,以生成涵盖更广言语事件类别的在线对话,对比两人之间与一人和最先进聊天机器人(即 Facebook 的 Blender)之间的对话。对这些生成对话的人工评估表明,人们更偏好人人对话,因为人机对话在大多数言语事件类别中缺乏连贯性。基于这些结果,我们建议:(a) 对当前在对话能力上尚不够“开放”的聊天机器人,使用“闲聊”而非“开放域”这一术语;(b) 修订评估方法,以在其他言语事件上检验聊天机器人对话。
引用
@article{arxiv.2211.13560,
title = {How "open" are the conversations with open-domain chatbots? A proposal for Speech Event based evaluation},
author = {A. Seza Doğruöz and Gabriel Skantze},
journal= {arXiv preprint arXiv:2211.13560},
year = {2022}
}