中文

ChatShopBuddy:面向可靠对话式购物智能体的强化学习方法

信息检索 2026-03-09 v1

摘要

对话式购物智能体是大型语言模型(LLM)驱动智能体的一个关键消费者应用场景,但如何有效地应用后训练强化学习(RL)来优化此类智能体仍然鲜有探索。本文研究了在真实场景中针对购物智能体的 RL 优化问题,智能体必须同时满足跨客观指标(产品正确性)、主观质量(说服力)、结果奖励(最终响应质量)和过程奖励(工具效率)等多个相互依赖的目标。我们提出了一整套解决方案方法。具体而言,我们首先构建了 SmartShopBench 数据集,该数据集捕捉了多样化购物意图,并采用分层评估将复杂的质量要求分解为可衡量的层级。基于此评估框架,我们设计了层次化奖励建模(HRM),通过条件门控机制对混合奖励类型进行结构化处理,反映其逻辑依赖关系。为实现高效训练,我们进一步提出了动态对比策略优化(DCPO),通过基于奖励和推理长度的动态轨迹选择,在响应质量和操作效率之间进行平衡。大量实验表明,我们训练的 RL 智能体——即 ChatShopBuddy—— consistently 超过依赖通用推理的更大模型,表现出更高的稳定性,而不仅仅是更高的峰值性能。我们的工作为将 RL 应用于真实世界对话式智能体提供了有价值的指导。

关键词

引用

@article{arxiv.2603.06065,
  title  = {ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning},
  author = {Yiruo Cheng and Kelong Mao and Tianhao Li and Jiejun Tan and Ji-Rong Wen and Zhicheng Dou},
  journal= {arXiv preprint arXiv:2603.06065},
  year   = {2026}
}