奖励驱动的交互:通过用户满意度预测提升主动对话代理
机器学习
2025-05-27 v1
摘要
奖励驱动的主动对话代理需要精确估计用户满意度作为内在奖励信号,以确定最佳交互策略。具体而言,该框架在检测到与话语中的潜在用户不满时,触发澄清问题,以应用于工业对话系统。传统方法通常依赖于基于弱标签训练的神经网络模型,这些标签是由在当前话轮之后的用户行为上训练的简单模型生成的。然而,现有方法在实际场景中存在两个关键局限性:(1)噪声奖励监督,依赖来自后事用户行为的弱标签会引入偏差,尤其在ASR错误导致的话语中难以捕捉满意度信号;(2)长尾反馈稀疏,用户查询的幂律分布导致在低频领域的奖励预测准确率下降。弱标签中的噪声和用户话语的幂律分布使得模型难以学习用户话语和会话的良好表征。为解决这些局限性,我们提出了两个辅助任务来提高用户话语和会话的表征学习,以增强用户满意度预测。第一个是对比自监督学习任务,帮助模型学习稀有用户话语的表征并识别ASR错误。第二个是领域意图分类任务,有助于模型从长尾领域学习用户会话的表征并提高模型在此类领域的性能。我们的方法在DuerOS上进行了评估,显示在稀有用户话语和长尾领域的错误识别准确率方面取得了显著提高。
引用
@article{arxiv.2505.18731,
title = {Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction},
author = {Wei Shen and Xiaonan He and Chuheng Zhang and Xuyun Zhang and Xiaolong Xu and Wanchun Dou},
journal= {arXiv preprint arXiv:2505.18731},
year = {2025}
}