迈向对话系统的自动评估:一种无模型离屏策略评估方法
计算与语言
2021-09-23 v3 人工智能
机器学习
摘要
在交互环境下对话系统的可靠自动评估长期未能实现。评估对话系统的理想环境(即图灵测试)需要涉及人类交互,这通常难以负担大规模实验。尽管研究者已尝试在语言生成任务中使用指标(如困惑度、BLEU)或某些基于模型的强化学习方法(如自博弈评估)进行自动评估,这些方法在实践中仅与实际人类评估呈现极弱的相关性。为弥合此差距,我们提出名为 ENIGMA 的新框架,基于强化学习中离屏策略评估的近期进展来估计人类评估分数。ENIGMA 仅需少量预先收集的经验数据,因此在评估期间不涉及与目标策略的人类交互,使自动评估可行。更重要的是,ENIGMA 是无模型且对收集经验数据的行为策略不可知(详见第2节),这显著缓解了建模复杂对话环境与人类行为的技术困难。我们的实验表明,ENIGMA 在与人类评估分数的相关性上显著优于现有方法。
引用
@article{arxiv.2102.10242,
title = {Towards Automatic Evaluation of Dialog Systems: A Model-Free Off-Policy Evaluation Approach},
author = {Haoming Jiang and Bo Dai and Mengjiao Yang and Tuo Zhao and Wei Wei},
journal= {arXiv preprint arXiv:2102.10242},
year = {2021}
}
备注
Conference on Empirical Methods in Natural Language Processing (EMNLP), 2021