人机安全:生成式 AI 与控制系统安全的后代
人工智能
2024-06-25 v2 计算机与社会
系统与控制
系统与控制
摘要
人工智能 (AI) 正以前所未有的规模与人类交互,为带来巨大的积极影响提供了新的途径,但也引发了广泛担忧关于其潜在对个人和社会造成伤害的风险。当前,人机安全的主流范式侧重于微调生成模型的输出,以更好地符合人类提供的示例或反馈。然而,实际情况下,AI 模型输出的后果不能以孤立的方式来判断:它们与人类用户的响应和行为紧密交织。本文从 AI 安全与控制系统安全中提炼出关键的互补经验,阐述开放挑战以及两者之间的关键协同效应。我们随后论证,针对先进 AI 技术而言,必须考虑由 AI 输出与人类行为构成的反馈回路如何可能引导互动走向不同结果。为此,我们提出一种统一的形式化方法,捕捉动态安全关键的人机互动,并提出面向下一代以人类为中心的人工智能安全的具体技术路线图。
引用
@article{arxiv.2405.09794,
title = {Human-AI Safety: A Descendant of Generative AI and Control Systems Safety},
author = {Andrea Bajcsy and Jaime F. Fisac},
journal= {arXiv preprint arXiv:2405.09794},
year = {2024}
}
备注
Revised version with refined exposition and technical details. 12 pages + references, 5 figures