DialogXpert:通过基于 LLM 先验的在线价值型强化学习驱动情感感知对话
计算与语言
2025-05-26 v1 人工智能
摘要
大语言模型 (LLM) 代理在反应式对话中表现出色,但由于捕获局限和高昂的规划成本,难以进行积极、目标导向的交互。我们提出 DialogXpert,通过冻结 LLM 提议一小组高质量的候选动作每个回合,并在固定的 BERT 嵌入上训练的紧凑 Q 网络通过时序差分学习在缩减后的空间中选择最优动作。通过跟踪用户情绪,DialogXpert 为每个决策定制,以推进任务同时培育真实、同情的联系。跨谈判、情感支持和辅导基准,DialogXpert 实现对话在 3 个回合内完成,成功率超过 94%;使用更大的 LLM 先验,可将成功率提升至 97%以上,同时显著改善谈判结果。该框架以规模化方式交付实时、战略性和情感智能的对话规划。代码可在 https://github.com/declare-lab/dialogxpert/ 获取
引用
@article{arxiv.2505.17795,
title = {DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors},
author = {Tazeek Bin Abdur Rakib and Ambuj Mehrish and Lay-Ki Soon and Wern Han Lim and Soujanya Poria},
journal= {arXiv preprint arXiv:2505.17795},
year = {2025}
}