中文

AI 消费者指数(ACE)

人工智能 2025-12-10 v3 计算与语言 人机交互

摘要

我们推出了 AI 消费者指数(ACE)的首个版本,这是一个用于评估前沿 AI 模型能否执行日常消费者任务的基准。ACE 包含一个隐藏的 400 个测试用例的留出集,分布在四项消费者活动中:购物、食品、游戏和 DIY。我们还以 CC-BY 许可证开源了 80 个用例作为开发集。在 ACE 排行榜上,我们使用一种新颖的评分方法对 10 个前沿模型(开启网页搜索)进行了评估,该方法动态检查响应中相关部分是否基于检索到的网页来源得到支撑。GPT 5(Thinking = High)表现最佳,得分为 56.1%,其次是 o3 Pro(Thinking = On)55.2% 和 GPT 5.1(Thinking = High)55.1%。模型得分在不同领域间存在差异,在购物领域最佳模型得分低于 50%。我们发现模型容易虚构关键信息,如价格。ACE 揭示了即使最佳模型的性能与消费者 AI 需求之间存在显著差距。

关键词

引用

@article{arxiv.2512.04921,
  title  = {The AI Consumer Index (ACE)},
  author = {Julien Benchek and Rohit Shetty and Benjamin Hunsberger and Ajay Arun and Zach Richards and Brendan Foody and Osvald Nitski and Bertie Vidgen},
  journal= {arXiv preprint arXiv:2512.04921},
  year   = {2025}
}