中文

论语言特征在生成式对话系统评价中的使用

计算与语言 2021-04-14 v1 机器学习

摘要

自动评价基于文本、非任务导向的对话系统(即“聊天机器人”)仍是一个开放问题。先前方法面临诸多挑战,从与人类判断相关性差到泛化能力差,且常需金标准参考用于比较或人工标注数据。扩展现有评价方法,我们提出基于语言特征的度量或能在不需金标准参考或人工标注数据的情况下,维持与人类判断的良好相关性且具可解释性。为支持此主张,我们测量并分析了多个对话模型所生成对话的各种语言特征。我们发现这些特征的行为与所测模型的已知性质一致,且跨领域相似。我们还展示该方法在评价回复相关性这一相关任务上具有零样本泛化到新领域等可喜性质。

关键词

引用

@article{arxiv.2104.06335,
  title  = {On the Use of Linguistic Features for the Evaluation of Generative Dialogue Systems},
  author = {Ian Berlot-Attwell and Frank Rudzicz},
  journal= {arXiv preprint arXiv:2104.06335},
  year   = {2021}
}