超越营销?AI 基准测试对从业者的信息价值
人工智能
2024-12-10 v1
摘要
公共 AI 基准测试结果被模型开发者广泛传播,作为日益增长且竞争激烈的市场中模型质量的指标。然而,这些公布的得分并不一定反映最终应用 AI 模型者的关注特质。在本文中,我们试图理解 AI 基准测试是否以及如何被用于辅助决策。基于对 19 位在日常工作中有使用或决定不使用基准测试的个体的访谈分析,我们发现,在这些场景中,参与者将基准测试用作模型间相对性能差异的信号。然而,这一信号是否被视为模型优越性的决定性标志、足以支撑下游决策,因情境而异。在学术界,公共基准测试通常被视为捕捉研究进展的合适度量。相比之下,在产品和政策领域,基准测试——即使是为特定任务内部开发的——常被认为不足以支撑实质性决策。在被认为不令人满意的基准测试中,受访者报告其目标既未明确定义,也未反映真实世界使用。基于研究结果,我们得出结论:有效的基准测试应提供有意义的真实世界评估、融入领域专业知识,并保持范围和目标的透明度。它们必须捕捉多样化的、与任务相关的能力,具有足够的挑战性以避免快速饱和,并考虑模型性能之间的权衡,而非依赖单一分数。此外,专有数据的收集和污染防范对于产生可靠且可操作的结果至关重要。遵循这些标准,基准测试可以超越单纯的营销手段,成为稳健的评估框架。
引用
@article{arxiv.2412.05520,
title = {More than Marketing? On the Information Value of AI Benchmarks for Practitioners},
author = {Amelia Hardy and Anka Reuel and Kiana Jafari Meimandi and Lisa Soder and Allie Griffith and Dylan M. Asmar and Sanmi Koyejo and Michael S. Bernstein and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2412.05520},
year = {2024}
}