中文

以自博弈近似开放域对话系统的交互式人工评估

计算与语言 2019-11-05 v2 人工智能 机器学习 机器学习

摘要

构建开放域对话智能体是一个具有挑战性的问题。当前的评估方法多为对静态对话的事后判断,无法在真实的交互情境中捕捉对话质量。在本文中,我们研究了交互式人工评估并为其必要性提供了证据;随后我们引入了一种新颖的、与模型无关且与数据集无关的方法来近似该评估。具体而言,我们提出了一种自博弈场景,其中对话系统与自己对话,并在对话轨迹上计算诸如情感与语义连贯性等代理指标的组合。我们表明,该指标比迄今已知的任何自动化指标都更能捕捉对话模型的人工评分质量,实现了显著的皮尔逊相关性(r>.7, p<.05)。为了研究所提出的新颖指标与交互式评估相较于最先进指标和静态对话人工评估的优势,我们使用一组模型进行了扩展实验,其中包括若干通过在话语层面进行情感与语义知识蒸馏对近期分层对话生成架构做出新颖改进的模型。最后,我们开源了所构建的交互式评估平台及所收集的数据集,以方便研究人员高效地部署和评估对话模型。

关键词

引用

@article{arxiv.1906.09308,
  title  = {Approximating Interactive Human Evaluation with Self-Play for Open-Domain Dialog Systems},
  author = {Asma Ghandeharioun and Judy Hanwen Shen and Natasha Jaques and Craig Ferguson and Noah Jones and Agata Lapedriza and Rosalind Picard},
  journal= {arXiv preprint arXiv:1906.09308},
  year   = {2019}
}

备注

33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada