基于用户满意度估计的域无关话轮级对话质量评估
机器学习
2019-08-21 v1 人工智能
计算与语言
机器学习
摘要
用于评估对话质量的自动化指标对优化数据驱动的对话管理至关重要。依赖对话中显式用户反馈的常规方法具有侵入性且稀疏。当前估计用户满意度的模型使用有限特征集并依赖标注者间信度低的标注方案,限制了对跨多域对话的泛化能力。为弥补这些不足,我们创建了基于新响应质量(Response Quality)标注方案的話轮级用户满意度指标。我们引入了五组新的域无关特征集,并尝试六种机器学习模型来估计该新满意度指标。使用响应质量标注方案,在来自 26 个域的随机采样单轮与多轮对话上,我们实现了高标注者间一致性(Spearman's rho 0.94)。响应质量标签与显式话轮级用户评分高度相关(0.76)。梯度提升回归在预测与标注的用户满意度标签间取得最佳相关性约 0.79。多层感知机与梯度提升回归模型比其它模型更好地泛化至未见域(线性相关 0.67)。最后,我们的消融研究证实新特征显著提升了模型性能。
引用
@article{arxiv.1908.07064,
title = {Domain-Independent turn-level Dialogue Quality Evaluation via User Satisfaction Estimation},
author = {Praveen Kumar Bodigutla and Longshaokan Wang and Kate Ridgeway and Joshua Levy and Swanand Joshi and Alborz Geramifard and Spyros Matsoukas},
journal= {arXiv preprint arXiv:1908.07064},
year = {2019}
}
备注
Implications of Deep Learning for Dialog Modeling - Special session at SIGdial 2019