构建、评估、优化:面向多智能体消费者助理的持续改进蓝图
人工智能
2026-05-04 v2 计算与语言
机器学习
摘要
对话式购物助理 (CSA) 代表了智能体 AI 的一个引人入胜的应用,但从原型走向实际应用揭示了两个被充分忽视的挑战:如何评估多轮交互以及如何优化紧密耦合的多智能体系统。购物场景进一步放大了这些困难,因为用户请求往往表述不完整、高度依赖个人偏好,且受到预算和库存等约束。本文提出了一套用于评估和优化对话式购物助理的实用蓝图,旨在生产规模的 AI 购物助理中进行实现。我们引入一种多维度评估评语谱, 将端到端购物质量分解为结构化维度,并开发了一个与人类标注一致的校准 LLM 评估管道。基于这一评估基础,我们研究了两种互补的提示优化策略,基于称为 GEPA(Shao 等,2025)的 SOTA 提示优化器:(1)子智能体 GEPA,通过局部评语优化单个智能体节点;(2)MAMuT(多智能体多轮)GEPA(Herrera 等,2026),是一种新的系统级方法,通过多轮模拟和轨迹级评分在智能体之间联合优化提示。我们发布了评语模板和评估设计指导,以支持构建生产级 CSA 的实践者。
引用
@article{arxiv.2603.03565,
title = {Build, Judge, Optimize: A Blueprint for Continuous Improvement of Multi-Agent Consumer Assistants},
author = {Alejandro Breen Herrera and Aayush Sheth and Steven G. Xu and Zhucheng Zhan and Charles Wright and Marcus Yearwood and Hongtai Wei and Sudeep Das and Danny Nightingale and Meg Watson and Charles Pollnow},
journal= {arXiv preprint arXiv:2603.03565},
year = {2026}
}