立场:AI安全必须拥抱反脆弱视角
人工智能
2025-09-18 v1
摘要
本立场论文认为,现代AI研究必须采用反脆弱视角来确保长期AI安全,如处理罕见或分布外(OOD)事件的能力随时间扩大。传统的静态基准和单次鲁棒性测试忽视了环境会演化的现实,若模型未受到挑战,可能会导致恶化适应(如奖励黑客、过度优化或能力退化)。我们认为,反脆弱方法——而非追求快速减少当前不确定性,而是利用这些不确定性以更好地为应对未来更大、更不可预测的不确定性做好准备——对于开放式ML系统的长期可靠性至关重要。在本立场论文中,我们首先识别了静态测试的关键局限性,包括场景多样性、奖励黑客和过度对齐问题。随后,我们探讨了反脆弱解决方案如何管理罕见事件的潜力。关键在于,我们倡导对AI安全的测量、基准测试和持续改进方法进行根本性的重新校准,以补充现有的鲁棒性方法,为培育反脆弱AI安全社区提供伦理和实用指南。
引用
@article{arxiv.2509.13339,
title = {Position: AI Safety Must Embrace an Antifragile Perspective},
author = {Ming Jin and Hyunin Lee},
journal= {arXiv preprint arXiv:2509.13339},
year = {2025}
}