中文

你的面向目标对话模型真的表现良好吗?系统级评估的实证分析

计算与语言 2020-05-18 v1 人工智能

摘要

开发面向目标对话系统的兴趣日益增长,这类系统通过多轮对话帮助用户完成复杂任务。尽管已提出许多方法来评估并改进各个对话组件的性能,但关于不同组件如何贡献于对话系统整体性能的综合性实证研究仍然匮乏。本文中,我们执行系统级评估,并对由不同模块在不同设定下构成的不同类型对话系统给出实证分析。我们的结果表明:(1) 在组件层面使用细粒度监督信号训练的流水线对话系统,常优于使用在粗粒度标签上训练的联合或端到端模型的系统;(2) 组件层面的单轮评估结果并不总是与对话系统的整体性能一致;(3) 尽管模拟器与真实用户之间存在差异,模拟评估仍是昂贵人工评估的有效替代方案,尤其在开发早期阶段。

关键词

引用

@article{arxiv.2005.07362,
  title  = {Is Your Goal-Oriented Dialog Model Performing Really Well? Empirical Analysis of System-wise Evaluation},
  author = {Ryuichi Takanobu and Qi Zhu and Jinchao Li and Baolin Peng and Jianfeng Gao and Minlie Huang},
  journal= {arXiv preprint arXiv:2005.07362},
  year   = {2020}
}

备注

SIGDIAL 2020 long paper