面向对话任务的大语言模型嵌入式嵌套滚动策略适应的通用高精度在线规划方法
计算与语言
2025-12-01 v1 人工智能
摘要
在目标导向对话任务中,主要挑战在于在有限的轮次内将交互引导至给定目标。现有方法要么依赖精心设计的提示工程,其有效性高度依赖人类经验,要么集成策略网络和预训练策略模型,这些模型通常难以适应新的对话情境且训练成本高昂。因此,本文提出了针对目标导向对话的嵌套滚动策略适应(NRPA-GD),这是一种完全避免特定模型训练的对话策略规划方法,利用大语言模型(LLM)同时模拟用户和系统的行为。具体而言,NRPA-GD 构建了对话轨迹的完整评估机制,并采用嵌套蒙特卡洛模拟与策略自适应的优化框架,以动态调整对话过程中的策略。在四个典型目标导向对话数据集上的实验结果表明,NRPA-GD 在性能上优于现有的提示工程方法和特定预训练模型方法。令人印象深刻的是,仅使用 6 亿参数的 LLM,NRPA-GD 就超越了 ChatGPT 和预训练策略模型。该方法进一步展示了在 LLM 上实现实际规划任务的规划方法的优势与新颖性。
引用
@article{arxiv.2511.21706,
title = {A General Highly Accurate Online Planning Method Integrating Large Language Models into Nested Rollout Policy Adaptation for Dialogue Tasks},
author = {Hui Wang and Fafa Zhang and Xiaoyu Zhang and Chaoxu Mu},
journal= {arXiv preprint arXiv:2511.21706},
year = {2025}
}