中文

基于用户满意度估计的多领域对话质量评估

机器学习 2019-11-21 v1 人机交互 机器学习

摘要

用于评估对话质量的自动化指标对于优化数据驱动的对话管理至关重要。依赖对话期间显式用户反馈的常规方法具有侵入性且稀疏。当前估计用户满意度的模型使用有限特征集,并采用对跨多领域对话泛化能力有限的标注方案。为弥补这些不足,我们创建了全新的 Response Quality 标注方案,引入了五组新的领域无关特征集,并尝试了六种机器学习模型,以在轮次与对话两个层面估计用户满意度。Response Quality 评分与显式轮次级用户评分实现了显著高相关性(0.76)。利用我们引入的新特征集,梯度提升回归模型在 26 个已见领域(线性相关约 0.79)与一个新多轮领域(线性相关 0.67)上取得了最佳(评分 [1-5])预测性能。我们观察到,在将预测的轮次级满意度评分作为特征纳入后,领域无关的对话级满意度估计模型的二分类(“满意/不满意”)预测准确率实现了 16% 的相对提升(68% -> 79%)。

关键词

引用

@article{arxiv.1911.08567,
  title  = {Multi-domain Conversation Quality Evaluation via User Satisfaction Estimation},
  author = {Praveen Kumar Bodigutla and Lazaros Polymenakos and Spyros Matsoukas},
  journal= {arXiv preprint arXiv:1911.08567},
  year   = {2019}
}

备注

The 3rd Conversational AI workshop: Today's practice and tomorrow's potential at NeurIPS 2019. arXiv admin note: substantial text overlap with arXiv:1908.07064