面向技术型AGI安全与安全的一种方法
人工智能
2025-04-03 v1 计算机与社会
机器学习
摘要
人工通用智能(AGI)虽然承诺带来变革性的益处,但也带来显著风险。我们构建了一种解决风险的方法,聚焦于足以显著危害人类的潜在风险。我们识别了四类风险:滥用、错失、错误以及结构性风险。其中,我们聚焦于针对滥用和错失的技术性方法。对于滥用,我们的策略旨在通过主动识别危险能力并实施稳健的安全措施、访问限制、监控以及模型安全缓解措施,防止威胁行为者获取危险能力。针对错失,我们概述了两条防御线。首先,模型层面的缓解措施,如放大监督和稳健训练可帮助构建对齐的模型;其次,系统层面的安全措施,如监控和访问控制可即使模型存在错位亦能减轻伤害。来自解释性、不确定性估计和更安全的设计模式的技术可增强这些缓解措施的有效性。最后,我们简要概述了这些组件如何组合以为AGI系统生成安全案例的方法。
引用
@article{arxiv.2504.01849,
title = {An Approach to Technical AGI Safety and Security},
author = {Rohin Shah and Alex Irpan and Alexander Matt Turner and Anna Wang and Arthur Conmy and David Lindner and Jonah Brown-Cohen and Lewis Ho and Neel Nanda and Raluca Ada Popa and Rishub Jain and Rory Greig and Samuel Albanie and Scott Emmons and Sebastian Farquhar and Sébastien Krier and Senthooran Rajamanoharan and Sophie Bridgers and Tobi Ijitoye and Tom Everitt and Victoria Krakovna and Vikrant Varma and Vladimir Mikulik and Zachary Kenton and Dave Orr and Shane Legg and Noah Goodman and Allan Dafoe and Four Flynn and Anca Dragan},
journal= {arXiv preprint arXiv:2504.01849},
year = {2025}
}