预测参与度:一种用于开放域对话系统自动评估的高效指标
计算与语言
2020-01-27 v2
摘要
用户参与度是评估开放域对话系统质量的关键指标。先前的工作通过使用启发式构建的特征(如对话轮数和对话总时长)关注对话级参与度。在本文中,我们研究了估计话语级参与度的可能性与有效性,并定义了一种新颖的指标——预测参与度(predictive engagement),用于开放域对话系统的自动评估。我们的实验表明:(1) 人类标注者在评估话语级参与度分数上具有高度一致性;(2) 对话级参与度分数可由适当聚合的话语级参与度分数预测。此外,我们展示了话语级参与度分数可从数据中学习。这些分数能够改进开放域对话系统的自动评估指标,这通过与人类判断的相关性得以体现。这表明预测参与度可用作训练更优对话模型的实时反馈。
引用
@article{arxiv.1911.01456,
title = {Predictive Engagement: An Efficient Metric For Automatic Evaluation of Open-Domain Dialogue Systems},
author = {Sarik Ghazarian and Ralph Weischedel and Aram Galstyan and Nanyun Peng},
journal= {arXiv preprint arXiv:1911.01456},
year = {2020}
}