中文

用于系统评估的多源人工智能记分卡表

人工智能 2021-02-09 v1 人机交互 机器学习

摘要

本文描述一种多源人工智能记分卡表(Multisource AI Scorecard Table, MAST),其为人工智能(AI)/机器学习(ML)系统的开发者与用户提供了一份标准检查清单,聚焦于情报界(IC)所采纳的良好分析原则,以助推动更可理解系统的开发并增进对 AI 输出的信任。此类记分卡可对用于商业与政府用途的 AI 工具实现透明、一致且有意义的认知。标准建立于通过政策的合规与共识之上,需利益相关方采纳。尽管测试的一致性或仅存在于标准数据集层面,学界仍须就验证与确认方法进行讨论,以导向可解释性、可说明性与恰当使用。本文探讨情报界指令(ICD)203 中概述的分析工艺标准如何为评估支撑各类作战需求的 AI 系统性能提供框架,这些需求包括溯源、不确定性、一致性、准确性与可视化。文中给出三个示意性用例以支持比较分析之安全性。

关键词

引用

@article{arxiv.2102.03985,
  title  = {Multisource AI Scorecard Table for System Evaluation},
  author = {Erik Blasch and James Sung and Tao Nguyen},
  journal= {arXiv preprint arXiv:2102.03985},
  year   = {2021}
}

备注

Presented at AAAI FSS-20: Artificial Intelligence in Government and Public Sector, Washington, DC, USA