如何评估对话模型:方法综述
计算与语言
2021-08-04 v1
摘要
评估对话系统的质量是一个研究不足的问题。评估方法的最新发展催生了本综述,旨在对现有方法进行明确而全面的分析。我们首次将评估方法分为三类,即自动评估、人工参与评估和基于用户模拟器的评估。然后,对每一类方法的主要特征和相关评估指标进行了介绍。文中还详细讨论了适用于对话技术评估的基准数据集的存在情况。最后,指出了一些开放性问题,以将评估方法推向新的前沿。
引用
@article{arxiv.2108.01369,
title = {How to Evaluate Your Dialogue Models: A Review of Approaches},
author = {Xinmeng Li and Wansen Wu and Long Qin and Quanjun Yin},
journal= {arXiv preprint arXiv:2108.01369},
year = {2021}
}