中文

迈向对话系统的自动评估:一种无模型离屏策略评估方法

计算与语言 2021-09-23 v3 人工智能 机器学习

摘要

在交互环境下对话系统的可靠自动评估长期未能实现。评估对话系统的理想环境(即图灵测试)需要涉及人类交互,这通常难以负担大规模实验。尽管研究者已尝试在语言生成任务中使用指标(如困惑度、BLEU)或某些基于模型的强化学习方法(如自博弈评估)进行自动评估,这些方法在实践中仅与实际人类评估呈现极弱的相关性。为弥合此差距,我们提出名为 ENIGMA 的新框架,基于强化学习中离屏策略评估的近期进展来估计人类评估分数。ENIGMA 仅需少量预先收集的经验数据,因此在评估期间不涉及与目标策略的人类交互,使自动评估可行。更重要的是,ENIGMA 是无模型且对收集经验数据的行为策略不可知(详见第2节),这显著缓解了建模复杂对话环境与人类行为的技术困难。我们的实验表明,ENIGMA 在与人类评估分数的相关性上显著优于现有方法。

关键词

引用

@article{arxiv.2102.10242,
  title  = {Towards Automatic Evaluation of Dialog Systems: A Model-Free Off-Policy Evaluation Approach},
  author = {Haoming Jiang and Bo Dai and Mengjiao Yang and Tuo Zhao and Wei Wei},
  journal= {arXiv preprint arXiv:2102.10242},
  year   = {2021}
}

备注

Conference on Empirical Methods in Natural Language Processing (EMNLP), 2021