基于日志记录用户反馈的多动作对话策略学习
计算与语言
2023-02-28 v1
摘要
多动作对话策略在每一轮生成多个原子对话动作,已广泛应用于任务型对话系统以提供富有表达力且高效的系统回复。现有策略模型通常从带标注的多动作对话样本中模仿动作组合。受数据限制,它们对未见的对话流程泛化能力差。虽有基于强化学习的方法将真实用户和服务评分器及用户模拟器的评分作为外部监督信号,但它们受困于稀疏且可信度低的对话级奖励。为应对该问题,我们探索利用历史预测(即日志记录用户反馈)所收到的显式与隐式轮次级用户反馈来改进多动作对话策略学习,此类反馈收集成本低且贴合真实场景。该任务具有挑战性,因为日志记录用户反馈仅提供限于智能体所预测的特定历史对话动作的局部标签反馈。为充分利用此类反馈信息,我们提出 BanditMatch,从反馈增强的半监督学习视角出发,以半监督学习与 bandit 学习的混合目标解决该任务。BanditMatch 整合伪标注方法,通过构造完整标签反馈来更好地探索动作空间。大量实验表明,我们的 BanditMatch 以更简洁且信息丰富的回复优于 SOTA 方法。本文源代码与附录可从 https://github.com/ShuoZhangXJTU/BanditMatch 获取。
引用
@article{arxiv.2302.13505,
title = {Multi-Action Dialog Policy Learning from Logged User Feedback},
author = {Shuo Zhang and Junzhou Zhao and Pinghui Wang and Tianxiang Wang and Zi Liang and Jing Tao and Yi Huang and Junlan Feng},
journal= {arXiv preprint arXiv:2302.13505},
year = {2023}
}
备注
AAAI 2023