中文

强化现实世界服务智能体:在任务导向对话中平衡效用与成本

计算与语言 2026-02-27 v1 人工智能

摘要

大型语言模型(LLM)的快速演进加速了从对话式聊天机器人向通用智能体的转变。然而,在有效平衡同理心沟通与预算敏感决策方面仍是一个开放挑战。由于现有方法未能捕捉这些复杂的战略权衡,我们提出 InteractCS-RL 框架,将任务导向对话重新定义为多粒度强化学习过程。具体而言,我们首先建立以用户为中心的交互框架,提供高保真训练环境,使智能体能够动态探索以 persona-driven 用户为驱动的多样策略。随后,我们引入成本感知多回合策略优化(Cost-aware Multi-turn Policy Optimization, CMPO),并采用混合优势估计策略。通过整合生成过程信用并运用 PID-Lagrangian 成本控制器,CMPO 有效引导策略在用户奖励与全局成本约束之间的 Pareto 前沿探索。在针对定制化真实商业场景的大规模实验中,InteractCS-RL 在三个评估维度上显著优于其他基线方法。进一步的评估在工具-智能体-用户交互基准上验证了 InteractCS-RL 在多样领域中的鲁棒性。

关键词

引用

@article{arxiv.2602.22697,
  title  = {Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue},
  author = {Ning Gao and Wei Zhang and Yuqin Dai and Ling Shi and Ziyin Wang and Yujie Wang and Wei He and Jinpeng Wang and Chaozheng Wang},
  journal= {arXiv preprint arXiv:2602.22697},
  year   = {2026}
}

备注

35 pages, 8 tables, 3 figures