CAUSE:任务型对话系统中用户满意度估计的反事实评估
计算与语言
2024-08-21 v2
摘要
以往关于任务型对话(TOD)系统用户满意度估计的研究中,一个未被探索的重要方面是在识别用户不满意的鲁棒性方面对其进行评估:当前 TOD 系统用户满意度估计的基准高度偏向于用户满意的对话。拥有更平衡的满意度标签集对性能的影响尚属未知。然而,用更多不满意的对话样本来平衡数据需要进一步的数据收集和人工标注,这既昂贵又耗时。在本工作中,我们利用大语言模型(LLM)并解锁其生成满意度感知反事实对话的能力,以扩充测试集的原始对话集合。我们收集人工标注以确保生成样本的可靠性。我们在扩充后的集合上评估了两个开源 LLM 作为用户满意度估计器的表现,并与最先进的微调模型进行对比。我们的实验表明,当作为少样本用户满意度估计器使用时,开源 LLM 对测试集中不满意标签数量的增加表现出比微调的最先进模型更高的鲁棒性。我们的结果揭示了 TOD 系统中用户满意度估计需要数据增强方法的必要性。我们发布了由人工标注精心制作的、对齐的反事实对话,以促进对该主题的进一步研究。
引用
@article{arxiv.2403.19056,
title = {CAUSE: Counterfactual Assessment of User Satisfaction Estimation in Task-Oriented Dialogue Systems},
author = {Amin Abolghasemi and Zhaochun Ren and Arian Askari and Mohammad Aliannejadi and Maarten de Rijke and Suzan Verberne},
journal= {arXiv preprint arXiv:2403.19056},
year = {2024}
}