中文

军事 AI的人类中心测试与评估

人机交互 2024-12-04 v1 人工智能

摘要

REAIM 2024 行动蓝图指出,AI 应用在军事领域应具有伦理性和人类中心性,且人类必须对其使用及影响负责。发展严格的测试与评估、验证与确认(TEVV)框架将有助于建立稳健的监督机制。AI 系统在开发和部署中的 TEVV 需要在整个生命周期中涉及人类用户。传统的人类中心测试与评估方法需要适应需要持续监控和评估的部署 AI 系统。应将 AI 启用系统的语言转变为包含人类(s)作为系统组件。需要提供支持这一调整定义的标准和要求,以及评估这些标准的指标和手段。人类中心 TEVV 的技术与政策制定者之间的对话将持续存在,但需要以具体目标为对话设定,以实现生产性。Throughout system lifecycle 的 TEVV 开发至关重要,以支持这一演变,包括人类可扩展性和规模化测试可实现性的问题。技术与非技术社区之间的沟通必须得到改善,以确保操作员和决策者理解系统使用所承担的风险,并更好地 inform 研究和开发。支持负责任 AI 部署的测试与评估必须包括人类的影响,以反映操作上实现的系统性能。将 TEVV 结果传达给使用和就 AI 基于系统的决策者的关键在于 inform 风险基础决策。

关键词

引用

@article{arxiv.2412.01978,
  title  = {Human-centred test and evaluation of military AI},
  author = {David Helmer and Michael Boardman and S. Kate Conroy and Adam J. Hepworth and Manoj Harjani},
  journal= {arXiv preprint arXiv:2412.01978},
  year   = {2024}
}

备注

11 pages, summary report from 'Human-centred test and evaluation of military AI' panel at Responsible AI in the Military Domain 2024, Seoul Korea, 9-10 September 2024