面向主动对话的无仿真层次潜在策略规划
计算与语言
2024-12-20 v1
摘要
近期的主动对话研究取得了显著进展,尤其关注更复杂的目标(如情感支持和说服)。与传统任务导向对话不同,主动对话需要更高级的策略规划和适应性,需要丰富的情景和全面的策略存储库来开发此类系统。然而,现有方法倾向于依赖大语言模型 (LLM) 进行用户仿真和在线学习,导致偏差偏离真实情景,结果导致次优效率。此外,这些方法依赖手动定义的、与上下文无关的、粗粒度的策略,这不仅增加了专家成本,也引发了策略完整性的疑虑。我们强调,能够从原始真实对话记录中自动发现策略的潜力。为此,我们提出一种新型对话策略规划框架 LDPP。它完全自动化了从在对话记录中发现策略到学习策略规划的整个过程。具体而言,我们采用变分自编码器的一种变体来发现表示为潜在向量的细粒度策略。通过这些潜在策略标签自动标注数据后,我们提出一种在潜在空间中开发有效策略规划能力的离线层次强化学习 (RL) 算法。我们的实验表明,LDPP 在两个主动场景中均优于现有方法,即使只使用 18 亿参数的 LLM 也能超越。
引用
@article{arxiv.2412.14584,
title = {Simulation-Free Hierarchical Latent Policy Planning for Proactive Dialogues},
author = {Tao He and Lizi Liao and Yixin Cao and Yuanxing Liu and Yiheng Sun and Zerui Chen and Ming Liu and Bing Qin},
journal= {arXiv preprint arXiv:2412.14584},
year = {2024}
}
备注
24 pages, 5 fgiures, AAAI 2025