模拟式规划:构建用户定制对话政策的内在用户世界模型
计算与语言
2025-04-21 v1
摘要
最近的对话政策规划进展强调优化系统代理政策以实现预定义目标,关注策略设计、轨迹获取和高效训练范式。然而,这些方法往往忽视了用户特征的关键作用,这在对话搜索和推荐等真实场景中至关重要,必须适应个体用户特征,如性格、偏好和目标。为此,我们首先利用特定于任务的用户persona进行全面研究,系统性地评估在不同用户行为下的对话政策规划。通过利用不同任务的真实用户配置文件,我们的研究揭示了现有方法的显著局限性,突出了对用户定制对话政策规划的需求。基于此,我们提出了用户定制对话政策规划(UDP)框架,包含内在用户世界模型来建模用户特征和反馈。UDP在三个阶段运行:(1)用户人物刻画,利用扩散模型动态推断用户配置文件;(2)用户反馈预测,利用受Brownian Bridge启发的预测器预测用户反应;(3)用户定制政策规划,将整合这些见解以优化响应策略。为确保稳健性能,我们进一步提出了一种主动学习方法,在训练期优先处理具有挑战性的用户persona。针对包括协作和非协作设置在内的多个基准进行全面实验,证明了UDP在学习用户特定对话策略方面的有效性。结果验证了该协议的实用性,并突显了UDP的鲁棒性、可适应性及其推动用户中心对话系统发展的潜力。
引用
@article{arxiv.2504.13643,
title = {Simulating Before Planning: Constructing Intrinsic User World Model for User-Tailored Dialogue Policy Planning},
author = {Tao He and Lizi Liao and Ming Liu and Bing Qin},
journal= {arXiv preprint arXiv:2504.13643},
year = {2025}
}
备注
11 pages, 6 figures, SIGIR 2025