中文

利用预测多重性衡量《人工智能法案》中的个体表现

机器学习 2026-02-13 v1 计算机与社会

摘要

在构建用于决策支持的AI系统时,人们经常遇到预测多重性现象:不存在单一的最佳模型;相反,可以构建许多具有相似整体准确率但在个体案例预测上存在差异的模型。特别是当决策直接影响人类时,这可能非常令人不满。对于模型间存在高度分歧的个人来说,本可以选择另一个具有相似整体准确率的模型,该模型可能会对该个人的案例做出不同的决定。我们认为,这种任意性与欧盟《人工智能法案》相冲突,该法案要求高风险AI系统的提供者不仅要在数据集层面报告性能,还要针对特定个人报告性能。本文的目标是将预测多重性与欧盟《人工智能法案》关于准确性的规定联系起来,并随后就如何在实践中评估和报告预测多重性提出具体建议。具体来说:(1)我们认为,纳入预测多重性信息有助于提供者遵守欧盟《人工智能法案》的准确性规定。(2)基于此法律分析,我们建议使用个体冲突比率和δ\delta-模糊度作为工具,量化模型在个体案例上的分歧,并帮助检测受冲突预测影响的个体。(3)基于计算洞察,我们推导出易于实施的规则,说明模型提供者如何在实践中评估预测多重性。(4)最终,我们建议根据《人工智能法案》,应将预测多重性信息提供给部署者,使他们能够判断系统对特定个人的输出是否足够可靠以用于其用例。

关键词

引用

@article{arxiv.2602.11944,
  title  = {Using predictive multiplicity to measure individual performance within the AI Act},
  author = {Karolin Frohnapfel and Mara Seyfert and Sebastian Bordt and Ulrike von Luxburg and Kristof Meding},
  journal= {arXiv preprint arXiv:2602.11944},
  year   = {2026}
}