LLM Agent遇见Agentic AI:LLM Agent能否模拟客户以评估基于Agentic AI的购物助手?
人机交互
2025-09-29 v1 计算与语言
摘要
Agentic AI正在不断发展,能够通过自然语言执行任务,例如用于编程的Copilot或用于购物的Amazon Rufus。评估这些系统面临挑战,因为其快速演进超出了传统人类评估的范围。研究人们提出使用LLM Agent来模拟参与者作为数字孪体,但究竟数字孪体能否代表特定客户在与Agentic AI系统进行多轮交互中,仍不明确。本文中,我们招募了40名人类参与者与Amazon Rufus进行购物,收集他们的角色、交互痕迹和用户体验反馈,然后创建数字孪体来重复完成此任务。人类与数字孪体痕迹的两两比较显示,尽管智能体通常探索了更多样化的选择,但其行动模式与人类一致,产生了类似的设计反馈。这项研究是首次量化LLM agents能多接近地镜像人类与Agentic AI系统进行多轮交互,凸显了其用于可扩展评估的潜力。
关键词
引用
@article{arxiv.2509.21501,
title = {LLM Agent Meets Agentic AI: Can LLM Agents Simulate Customers to Evaluate Agentic-AI-based Shopping Assistants?},
author = {Lu Sun and Shihan Fu and Bingsheng Yao and Yuxuan Lu and Wenbo Li and Hansu Gu and Jiri Gesi and Jing Huang and Chen Luo and Dakuo Wang},
journal= {arXiv preprint arXiv:2509.21501},
year = {2025}
}