中文

现实世界 AI 评估:FRAME 如何生成系统性证据以解决决策者的困境

计算机与社会 2026-03-31 v4 人工智能

摘要

组织领导者正被要求在缺乏可靠证据的情况下,对 AI 部署作出重大决策。当前主流的 AI 评估生态系统产生可扩展但抽象的指标,这些指标反映模型开发方的优先事项。通过平滑处理实际使用情境的异构性,这些模型中心方法掩盖了行为在不同用户、工作流程和环境中的变化,极少展示风险与价值在实践中如何累积。更以用户为中心的研究虽揭示丰富的情境细节,却往往碎片化、规模小且松散地与塑造模型行为的机制关联不紧密。论文介绍了 FORUM FOR REAL-WORLD AI MEASUREMENT AND EVALUATION(FRAME),旨在弥合这一差距,通过结合大规模 AI 系统试验与结构化观察,系统性地捕捉 AI 系统在实际情境中的使用方式、所产生的结果以及这些结果如何形成。FRAME 通过追踪 AI 系统输出经历的路径——从输出到实际使用再到后续效应——将 AI 使用情境的异构性转化为可衡量的信号,而非为实现规模性质权衡。论文阐述了 FRAME 建立的两项核心资产:一个捕捉规模化 AI 使用情境的测试沙箱(Testing Sandbox),以及将这些轨迹转化为可操作指标的指标中心(Metrics Hub)。

关键词

引用

@article{arxiv.2603.13294,
  title  = {Real-World AI Evaluation: How FRAME Generates Systematic Evidence to Resolve the Decision-Maker's Dilemma},
  author = {Reva Schwartz and Gabriella Waters},
  journal= {arXiv preprint arXiv:2603.13294},
  year   = {2026}
}

备注

19 pages, 4 tables, 5 figures