中文

面向AI安全的机器遗忘中的开放问题

机器学习 2025-01-10 v1 人工智能 计算机与社会

摘要

随着AI系统在网络安全、生物研究和医疗保健等关键领域变得能力更强、部署更广泛且日益自主,确保其安全性和与人类价值观的一致性至关重要。机器遗忘——选择性遗忘或抑制特定类型知识的能力——在隐私和数据移除任务中已显示出前景,这也是现有研究的主要焦点。最近,其在AI安全中的潜在应用引起了关注。在本文中,我们指出了阻碍遗忘成为AI安全全面解决方案的关键限制,特别是在管理网络安全和化学、生物、放射性和核(CBRN)安全等敏感领域的双重用途知识方面。在这些情境中,信息既可能有益也可能有害,模型可能将看似无害的信息组合用于有害目的——遗忘这些信息可能会严重影响有益用途。我们概述了固有的约束和开放问题,包括遗忘危险知识的更广泛副作用,以及之前未探索的遗忘与现有安全机制之间的紧张关系。最后,我们研究了与评估、鲁棒性以及在遗忘过程中保持安全特性相关的挑战。通过描绘这些限制和开放挑战,我们旨在引导未来研究在更广泛的AI安全框架内实现遗忘的现实应用,承认其局限性并突出可能需要替代方法的领域。

关键词

引用

@article{arxiv.2501.04952,
  title  = {Open Problems in Machine Unlearning for AI Safety},
  author = {Fazl Barez and Tingchen Fu and Ameya Prabhu and Stephen Casper and Amartya Sanyal and Adel Bibi and Aidan O'Gara and Robert Kirk and Ben Bucknall and Tim Fist and Luke Ong and Philip Torr and Kwok-Yan Lam and Robert Trager and David Krueger and Sören Mindermann and José Hernandez-Orallo and Mor Geva and Yarin Gal},
  journal= {arXiv preprint arXiv:2501.04952},
  year   = {2025}
}