中文

现实检验:理解 AI 实际影响力所需的全新评估生态系统

计算机与社会 2025-06-02 v4 人工智能

摘要

传统的 AI 评估方法局限于 AI 堆栈内部,无法充分探索、导航和解决在现实部署中出现的各种人类和社会因素,这些因素在教育、金融、医疗和就业等领域尤为突出。AI 能力评估可以捕捉关于一级效应的细节,例如系统输出是否准确,或是否包含有毒、偏见或刻板印象的内容;但随着技术嵌入我们日常生活,AI 的二级效应——即由 AI 在现实世界中使用可能产生的长期结果和后果——已成为关注的重点。这些二级效应可能包括用户行为的变化、社会、文化和经济层面的影响、劳动力的转型,以及因一广泛且不断增长的风险集合而产生的长期下游影响。本position论文论证,测量 AI 的间接和二级效应将需要超越局部、单轮式的计算机内测试方法,引入能够捕捉在具体情境下人们如何实际使用 AI 技术的测试范式。具体而言,我们描述了为促进情境感知、启用下游解释和决策以评估 AI 的二级效应所需的数据和方法,并提出了构建新生态系统的要求。

关键词

引用

@article{arxiv.2505.18893,
  title  = {Reality Check: A New Evaluation Ecosystem Is Necessary to Understand AI's Real World Effects},
  author = {Reva Schwartz and Rumman Chowdhury and Akash Kundu and Heather Frase and Marzieh Fadaee and Tom David and Gabriella Waters and Afaf Taik and Morgan Briggs and Patrick Hall and Shomik Jain and Kyra Yee and Spencer Thomas and Sundeep Bhandari and Paul Duncan and Andrew Thompson and Maya Carlyle and Qinghua Lu and Matthew Holmes and Theodora Skeadas},
  journal= {arXiv preprint arXiv:2505.18893},
  year   = {2025}
}

备注

9 pages