通过元研究:可信 AI 在医疗保健领域的进展——基于跨学科设计思维工作坊的结果
机器学习
2026-04-07 v2 人工智能
摘要
现有评估方法主要依赖干净、静态基准测试,这会导致高估模型性能,因为未能捕捉真实用户输入中固有的噪声和变异性。这一点尤其适用于语言模型,它们可能面临包含错误、拼写错误或以不同方式表述相同问题的人类生成文本查询。在本文中,我们提出了量化模型对提示变体敏感性(即脆弱性)的理论框架,以此 disentangle 数据引起的难度与提示相关的变异性。利用该框架,我们设计了一种新型评估管道——Brittlebench,以全面评估前沿模型的敏感性。我们对流行基准测试应用语义保持变换,并观察到模型性能下降最高可达 12%。然而,这些变换并未对所有模型影响相同:甚至只进行一次变换就会在 63% 的情况下改变模型的相对排名,从而影响有关模型之间比较性能的结论。对数据驱动型开源权重模型和商业模型的总方差进行分解,我们发现语义保持的输入变换可为给定模型的性能方差占比达到一半。Brittlebench 凸显了需要更健壮的评估和模型的必要性,并使我们能够系统性地理解模型的脆弱性。
引用
@article{arxiv.2603.13285,
title = {Brittlebench: Quantifying LLM robustness via prompt sensitivity},
author = {Angelika Romanou and Mark Ibrahim and Candace Ross and Chantal Shaib and Kerem Oktar and Samuel J. Bell and Anaelia Ovalle and Jesse Dodge and Antoine Bosselut and Koustuv Sinha and Adina Williams},
journal= {arXiv preprint arXiv:2603.13285},
year = {2026}
}