中文

EcomBench:面向电子商务中基础智能体的整体评估

人工智能 2025-12-12 v2

摘要

基础智能体在推理和与真实环境交互方面的能力迅速发展,使其核心能力的评估日益重要。虽然已开发了许多基准来评估智能体性能,但大多数集中于学术环境或人工设计的场景,而忽略了真实应用中出现的挑战。为了解决这一问题,我们聚焦于一个高度实用的真实场景——电子商务领域,该领域涉及大量多样的用户交互、动态市场条件以及与真实决策过程直接相关的任务。为此,我们推出了 EcomBench,一个全面的电子商务基准,旨在评估智能体在真实电子商务环境中的性能。EcomBench 源自嵌入在领先全球电子商务生态系统中的真实用户需求,并通过人工专家精心策划和标注,以确保清晰性、准确性和领域相关性。它涵盖了电子商务场景中的多个任务类别,并定义了三个难度级别,在深度信息检索、多步推理和跨源知识整合等关键能力上评估智能体。通过将评估建立在真实电子商务背景下,EcomBench 为衡量现代电子商务中智能体的实践能力提供了一个严格且动态的测试平台。

关键词

引用

@article{arxiv.2512.08868,
  title  = {EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce},
  author = {Rui Min and Zile Qiao and Ze Xu and Jiawen Zhai and Wenyu Gao and Xuanzhong Chen and Haozhen Sun and Zhen Zhang and Xinyu Wang and Hong Zhou and Wenbiao Yin and Bo Zhang and Xuan Zhou and Ming Yan and Yong Jiang and Haicheng Liu and Liang Ding and Ling Zou and Yi R. Fung and Yalong Li and Pengjun Xie},
  journal= {arXiv preprint arXiv:2512.08868},
  year   = {2025}
}