中文

如何评估对话模型:方法综述

计算与语言 2021-08-04 v1

摘要

评估对话系统的质量是一个研究不足的问题。评估方法的最新发展催生了本综述,旨在对现有方法进行明确而全面的分析。我们首次将评估方法分为三类,即自动评估、人工参与评估和基于用户模拟器的评估。然后,对每一类方法的主要特征和相关评估指标进行了介绍。文中还详细讨论了适用于对话技术评估的基准数据集的存在情况。最后,指出了一些开放性问题,以将评估方法推向新的前沿。

关键词

引用

@article{arxiv.2108.01369,
  title  = {How to Evaluate Your Dialogue Models: A Review of Approaches},
  author = {Xinmeng Li and Wansen Wu and Long Qin and Quanjun Yin},
  journal= {arXiv preprint arXiv:2108.01369},
  year   = {2021}
}