中文

面向高风险可靠性的对抗训练

机器学习 2022-11-11 v5 人工智能 计算与语言

摘要

未来,强大的 AI 系统可能被部署在高风险环境中,其中单次故障就可能是灾难性的。一种用于提升高风险环境下 AI 安全性的技术是对抗训练,它利用对手生成训练样本,以获得更好的最坏情况性能。在这项工作中,我们使用一个安全的语言生成任务(“避免伤害”)作为通过对抗训练实现高可靠性的测试平台。我们创建了一系列对抗训练技术——包括一个辅助人类对手的工具——来发现并消除一个对生成器建议的文本补全进行过滤的分类器中的故障。在我们的任务中,我们确定可以在不显著影响过滤输出质量的情况下设置非常保守的分类器阈值。我们发现对抗训练提升了对我们所训练的对抗攻击的鲁棒性——使我们的承包商借助该工具找到对抗样本的时间翻倍(从 13 到 26 分钟),无工具时亦翻倍(从 20 到 44 分钟)——且不影响分布内性能。我们希望看到更多在高风险可靠性环境下的工作,包括更强大的增强人类对手的工具,以及更好的衡量高可靠性水平的方法,直到我们能够自信地排除强大模型在部署时灾难性故障的可能性。

关键词

引用

@article{arxiv.2205.01663,
  title  = {Adversarial Training for High-Stakes Reliability},
  author = {Daniel M. Ziegler and Seraphina Nix and Lawrence Chan and Tim Bauman and Peter Schmidt-Nielsen and Tao Lin and Adam Scherlis and Noa Nabeshima and Ben Weinstein-Raun and Daniel de Haas and Buck Shlegeris and Nate Thomas},
  journal= {arXiv preprint arXiv:2205.01663},
  year   = {2022}
}

备注

30 pages, 7 figures, NeurIPS camera-ready