中文

梦想到聊天:基于用户信念建模的对话模型强化学习

计算与语言 2025-09-29 v3 人工智能

摘要

世界模型在机器人、游戏和自动驾驶等领域得到了广泛应用,但在自然语言任务上的应用相对有限。本文构建了对话世界模型,该模型能够预测用户的情绪、情感和意图,以及未来的言语。通过定义POMDP,我们认为情绪、情感和意图可以建模为用户信念,并通过最大化信息瓶颈来求解。通过用户信念建模,我们将模型基强化学习框架应用于对话系统,提出了称为DreamCUB的框架。实验表明,预训练的对话世界模型在情绪分类和情感识别方面达到最新水平,而通过策略、批评家和对话世界模型联合训练,还能提高对话质量。进一步分析显示,这种方式在保持合理的探索-开发平衡方面具有可行性,并且在如同理对话等跨域场景中也能良好迁移。

关键词

引用

@article{arxiv.2508.16876,
  title  = {Dream to Chat: Model-based Reinforcement Learning on Dialogues with User Belief Modeling},
  author = {Yue Zhao and Xiaoyu Wang and Dan Wang and Zhonglin Jiang and Qingqing Gu and Teng Chen and Ningyuan Xi and Jinxian Qu and Yong Chen and Luo Ji},
  journal= {arXiv preprint arXiv:2508.16876},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings