中文

CIRCLE:面向真实场景的人工智能评估框架

人工智能 2026-03-26 v4 软件工程

摘要

本文提出CIRCLE框架——一个六阶段、基于生命周期的框架,旨在弥合模型中心绩效指标与AI在部署中实际产出之间存在的现实差距。当前方法,如MLOps框架和AI模型基准测试,虽能提供系统稳定性和模型能力的详细洞察,但未能为AI堆栈之外的决策者提供系统化的证据,证明这些系统在真实世界情境中如何表现或随时间影响其组织。CIRCLE将TEVV(测试、评估、验证和验证)验证阶段的实现化,通过正式化将堆栈之外的利益相关者关切转化为可衡量信号。不同于往往局限于参与式设计或常为事后回顾的算法审计,CIRCLE提供了一种结构化的、前瞻性的协议,将具有情境敏感性的定性洞察与可扩展的量化指标相结合。通过将现场测试、红队攻击和纵向研究等方法整合到协调管道中,CIRCLE产生系统化知识:在各站点间具备可比性 yet 具备当地情境敏感性的证据。这将使治理能够基于实际下游影响,而非理论能力。

关键词

引用

@article{arxiv.2602.24055,
  title  = {CIRCLE: A Framework for Evaluating AI from a Real-World Lens},
  author = {Reva Schwartz and Carina Westling and Morgan Briggs and Marzieh Fadaee and Isar Nejadgholi and Matthew Holmes and Fariza Rashid and Maya Carlyle and Afaf Taïk and Kyra Wilson and Peter Douglas and Theodora Skeadas and Gabriella Waters and Rumman Chowdhury and Thiago Lacerda},
  journal= {arXiv preprint arXiv:2602.24055},
  year   = {2026}
}

备注

Accepted at Intelligent Systems Conference (IntelliSys) 2026