AD-Bench:面向 LLM 智能体的真实场景、轨迹感知的广告分析基准
计算与语言
2026-02-17 v1 人工智能
信息检索
机器学习
摘要
虽然大语言模型 (LLM) 智能体在复杂推理任务中取得了显著进展,但评估其在真实环境中的性能已成为关键问题。当前的基准大多局限于理想化的仿真环境,无法满足广告和营销分析等专业领域的实际需求。在这些领域,任务本质上更为复杂,往往需要与专业营销工具进行多轮交互。为此,我们提出AD-Bench,一个基于广告和营销平台真实业务需求构建的基准。AD-Bench由真实用户的营销分析请求构建,由领域专家提供可验证的参考答案及相应的参考工具调用轨迹。基准将请求划分为三个难度等级 (L1-L3),以评估智能体在多轮、多工具协作下的能力。实验表明,在AD-Bench上,Gemini-3-Pro的Pass@1为68.0%,Pass@3为83.0%,但在L3难度下性能显著下降,Pass@1降至49.4%,Pass@3降至62.1%,轨迹覆盖率为70.1%,表明即使是最先进的模型在复杂广告和营销分析场景中仍存在显著的能力缺口。AD-Bench为评估和改进广告营销智能体提供了真实可靠的基准,相关排行榜和代码可在https://github.com/Emanual20/adbench-leaderboard查阅。
引用
@article{arxiv.2602.14257,
title = {AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents},
author = {Lingxiang Hu and Yiding Sun and Tianle Xia and Wenwei Li and Ming Xu and Liqun Liu and Peng Shu and Huan Yu and Jie Jiang},
journal= {arXiv preprint arXiv:2602.14257},
year = {2026}
}
备注
15 pages, 11 figures