用于系统评估的多源人工智能记分卡表
人工智能
2021-02-09 v1 人机交互
机器学习
摘要
本文描述一种多源人工智能记分卡表(Multisource AI Scorecard Table, MAST),其为人工智能(AI)/机器学习(ML)系统的开发者与用户提供了一份标准检查清单,聚焦于情报界(IC)所采纳的良好分析原则,以助推动更可理解系统的开发并增进对 AI 输出的信任。此类记分卡可对用于商业与政府用途的 AI 工具实现透明、一致且有意义的认知。标准建立于通过政策的合规与共识之上,需利益相关方采纳。尽管测试的一致性或仅存在于标准数据集层面,学界仍须就验证与确认方法进行讨论,以导向可解释性、可说明性与恰当使用。本文探讨情报界指令(ICD)203 中概述的分析工艺标准如何为评估支撑各类作战需求的 AI 系统性能提供框架,这些需求包括溯源、不确定性、一致性、准确性与可视化。文中给出三个示意性用例以支持比较分析之安全性。
引用
@article{arxiv.2102.03985,
title = {Multisource AI Scorecard Table for System Evaluation},
author = {Erik Blasch and James Sung and Tao Nguyen},
journal= {arXiv preprint arXiv:2102.03985},
year = {2021}
}
备注
Presented at AAAI FSS-20: Artificial Intelligence in Government and Public Sector, Washington, DC, USA