通过目标导向偏好优化解耦任务导向对话中的策略与执行
计算与语言
2026-02-23 v2 人工智能
摘要
大语言模型在任务导向对话系统中显示出潜力,但现有的训练方法往往依赖于 token 级别的似然或偏好优化,这与长期任务成功性不吻合。为此,我们提出目标导向偏好优化(GOPO),这是一种层次化强化学习框架,通过 Expert Agent 和 Customer Service Agent 解耦策略规划与响应生成。Expert Agent 在对话轨迹水平上优化多轮目标偏好,而 Customer Service Agent 生成严格遵循所选策略的响应。我们在公共基准和电商客户服务数据集上评估 GOPO,引入基于真实电商交互数据衍生的任务聚焦顺序参与(TSE)指标。在 Mgshop 数据集上,GOPO 相较于 PPO 和 Memento 提升了 7.7%和 10.3%,在序列级奖励和生成质量方面表现一致。此外,使用 GOPO 训练的 14B 模型在 Qwen-235B 和 GPT-5.2 方面分别取得 2.7%和 1.5%的更高 TSE。消融研究确认 Expert Agent 在长期优化中的关键作用。GOPO 在其他数据集上也表现出一致的改进。这项工作为商业场景下的任务导向对话系统建立了新的范式,代码和数据集将对外公开。
引用
@article{arxiv.2602.15854,
title = {Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization},
author = {Jingyi Xu and Xingyu Ren and Zhoupeng Shou and Yumeng Zhang and Zhiqiang You},
journal= {arXiv preprint arXiv:2602.15854},
year = {2026}
}