NSF 关于安全 AI 科学工作坊报告
计算机与社会
2025-07-01 v1 人工智能
摘要
近期的机器学习进展,尤其是基础模型的出现,正在为开发解决社会问题的技术性解决方案提供新的机遇。然而,当今复杂 AI 模型的推理过程和内部工作方式并不透明,且无法对其预测结果提供安全保证。因此,要实现 AI 的承诺,我们必须解决以下科学挑战:如何开发出不仅准确且高效,还能确保安全可信的 AI 系统?对于自主控制和机器人系统而言,安全操作的至关重要性尤为突出,这也是 NSF Safe Learning Enabled Systems(SLES)计划的催化剂。对于更广泛的 AI 应用场景,如用户与聊天机器人互动或医生接收治疗建议而言,安全性虽然同样重要,但定义较为模糊,具有情境依赖性。于是,我们组织了一场为期一天的工作坊,于 2025 年 2 月 26 日在宾夕法尼亚大学举行,旨在召集由 NSF SLES 项目资助的研究者,并结拓自更广泛的研究 AI 安全的学者。本报告即源自该工作坊中围绕安全议题展开的小组讨论结果。报告阐述了一项新的研究议程,聚焦于发展为下一代 AI 驱动系统奠定基础的理论、方法与工具。
引用
@article{arxiv.2506.22492,
title = {Report on NSF Workshop on Science of Safe AI},
author = {Rajeev Alur and Greg Durrett and Hadas Kress-Gazit and Corina Păsăreanu and René Vidal},
journal= {arXiv preprint arXiv:2506.22492},
year = {2025}
}