ChatShopBuddy:面向可靠对话式购物智能体的强化学习方法
信息检索
2026-03-09 v1
摘要
对话式购物智能体是大型语言模型(LLM)驱动智能体的一个关键消费者应用场景,但如何有效地应用后训练强化学习(RL)来优化此类智能体仍然鲜有探索。本文研究了在真实场景中针对购物智能体的 RL 优化问题,智能体必须同时满足跨客观指标(产品正确性)、主观质量(说服力)、结果奖励(最终响应质量)和过程奖励(工具效率)等多个相互依赖的目标。我们提出了一整套解决方案方法。具体而言,我们首先构建了 SmartShopBench 数据集,该数据集捕捉了多样化购物意图,并采用分层评估将复杂的质量要求分解为可衡量的层级。基于此评估框架,我们设计了层次化奖励建模(HRM),通过条件门控机制对混合奖励类型进行结构化处理,反映其逻辑依赖关系。为实现高效训练,我们进一步提出了动态对比策略优化(DCPO),通过基于奖励和推理长度的动态轨迹选择,在响应质量和操作效率之间进行平衡。大量实验表明,我们训练的 RL 智能体——即 ChatShopBuddy—— consistently 超过依赖通用推理的更大模型,表现出更高的稳定性,而不仅仅是更高的峰值性能。我们的工作为将 RL 应用于真实世界对话式智能体提供了有价值的指导。
引用
@article{arxiv.2603.06065,
title = {ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning},
author = {Yiruo Cheng and Kelong Mao and Tianhao Li and Jiejun Tan and Ji-Rong Wen and Zhicheng Dou},
journal= {arXiv preprint arXiv:2603.06065},
year = {2026}
}