中文

为AI评估走向“苹果对比”:从真实应用场景到评估情景

人机交互 2026-05-11 v1 人工智能 计算机与社会

摘要

AI测量科学存在多样化的方法和测量手段,用于比较AI系统,导致常出现不同AI评估间的"苹果对橘子"比较。为实现真实AI评估中的"苹果对比",本工作主张在评估情景中实现方法论透明度、实务 grounding,以及人本设计(HCD)原则。我们提出一种将高层次用例转化为详细情景的可重复流程,通过结构化AI用例工作表从受访专家处挖掘用例,工作表包含六个关键要素:用例、行业、用户(直接和间接)、预期结果、预期影响(正面和负面)以及关键绩效指标和度量标准。我们演示了工作表和流程在美国金融服务行业的实用性。本文报告了来自金融服务行业受访专家识别的示例高层次AI用例:网络防御增强、开发者生产力、金融犯罪聚合、可疑活动报告(SAR)提交、信用备忘录生成以及内部呼叫中心支持。这些AI用例是该流程的示例,並非穷尽。我们工作的核心是将LLM prompting与人类审阅相结合的三阶段扩建管道,从受访专家挖掘的用例中生成107个情景。在每个环节都集成迭代的人类审阅,以确保实务 grounding:情景标题和描述;核心情景要素如用户、收益和风险、度量标准;以及情景叙事和评估目标。人类检查点确保情景仍反映真实使用场景和人类需求。我们描述了一个用于评估情景质量的验证量表。通过定义关键情景组成部分,本工作支持更一致和有意义的人本AI评估范式。

关键词

引用

@article{arxiv.2605.07986,
  title  = {Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios},
  author = {Yee-Yin Choong and Kristen Greene and Alice Qian and Meryem Marasli and Ziqi Yang and Sophia Chen and Laura Dabbish and Anand Rao and Hong Shen},
  journal= {arXiv preprint arXiv:2605.07986},
  year   = {2026}
}

备注

23 pages, 3 figures