中文

追问历史:一种高效实用的开放域聊天机器人一致性评估框架

计算与语言 2021-06-07 v1 人工智能

摘要

一个好的开放域聊天机器人应避免在会话中就事实或观点给出相互矛盾的回复,这被称为其一致性能力。然而,评估聊天机器人的一致性能力仍具挑战。雇用人工评判主动与聊天机器人交互以检查其能力成本高、效率低,且难以摆脱主观偏差。本文中,我们提出追问历史(Addressing Inquiries about History, AIH),一种高效实用的一致性评估框架。在对话阶段,AIH 试图提出关于对话历史的恰当追问,以诱导聊天机器人重申历史事实或观点。我们让聊天机器人之间展开对话,这比人机交互更高效,也能缓解主观偏差。由此,我们得以快速获得包含高矛盾可能性回复的对话会话。在矛盾识别阶段,我们可雇用人工评判或自然语言推理(NLI)模型来识别追问的回答是否与历史矛盾。最终,我们能够根据矛盾统计对聊天机器人排序。在开放域聊天机器人上的实验表明,我们的方法能高效可靠地评估聊天机器人一致性能力,并与人工评估呈现高排序相关性。我们发布该框架,希望有助于提升聊天机器人一致性能力。\footnote{\url{https://github.com/ictnlp/AIH}}

关键词

引用

@article{arxiv.2106.02228,
  title  = {Addressing Inquiries about History: An Efficient and Practical Framework for Evaluating Open-domain Chatbot Consistency},
  author = {Zekang Li and Jinchao Zhang and Zhengcong Fei and Yang Feng and Jie Zhou},
  journal= {arXiv preprint arXiv:2106.02228},
  year   = {2021}
}

备注

Findings of ACL2021