中文

衡量关键所在:将 AI 伦理评估与系统属性、危害及伤害相连接

人机交互 2025-10-14 v1 人工智能 机器学习

摘要

在过去十年中,一个用于评估 AI 系统社会与伦理影响的度量生态已经形成,这些度量主要受高层级伦理原则的塑造。这些度量以碎片化的方式被开发和使用,未能充分关注它们在 AI 系统中所处的位置。在本文中,我们考察了计算文献中现有度量如何映射到 AI 系统组件、属性、危害与伤害。我们的分析基于一项范围审查,涵盖了对应于 11 项 AI 伦理原则的近 800 项度量。我们发现,大多数度量聚焦于四项原则——公平性、透明性、隐私和信任——并主要评估模型或输出层面的系统组件。很少有度量考虑到系统元素之间的交互作用,且针对每种伤害类型通常仅考虑一小部分危害。许多度量与伤害发生的位置脱节,且缺乏设定有意义阈值的指导。这些模式揭示了当前评估实践仍呈碎片化状态——它们在零散地测量,而非捕捉伤害如何在系统中涌现。将度量置于系统属性、危害与伤害的框架下加以审视,可以强化监管监督、支持业界采取可操作的实践,并为未来的研究奠定系统级理解的基础。

关键词

引用

@article{arxiv.2510.10339,
  title  = {Measuring What Matters: Connecting AI Ethics Evaluations to System Attributes, Hazards, and Harms},
  author = {Shalaleh Rismani and Renee Shelby and Leah Davis and Negar Rostamzadeh and AJung Moon},
  journal= {arXiv preprint arXiv:2510.10339},
  year   = {2025}
}