自毁模型:提高基础模型有害双重用途的成本
机器学习
2023-08-10 v2
摘要
日益壮大的大型开源基础模型生态系统降低了将机器学习应用于许多新问题所需的标注数据和技术专长。然而,基础模型带来了明显的双重用途风险,不加区分地降低了构建有害和有益机器学习系统的成本。受限模型访问和出口管制等政策工具是目前用于缓解此类双重用途风险的主要方法。在这项工作中,我们回顾了潜在的safe-release策略,并认为政策制定者和AI研究人员都将受益于从根本上新的技术,以实现对开源基础模型下游用途的更精确控制。我们提出了这样一种方法:任务阻断范式,其中基础模型在训练时附加一种机制,以阻碍对有害任务的适配,同时不牺牲在期望任务上的性能。我们将由此产生的模型称为自毁模型,其灵感来自防止对手将工具用于有害目的的机制。我们提出了一种利用元学习和对抗学习技术训练自毁模型的算法,称之为元学习对抗审查(MLAC)。在一个小规模实验中,我们表明MLAC可以在很大程度上防止一个BERT风格的模型被重新用于执行性别识别,同时不损害该模型执行职业分类的能力。
引用
@article{arxiv.2211.14946,
title = {Self-Destructing Models: Increasing the Costs of Harmful Dual Uses of Foundation Models},
author = {Peter Henderson and Eric Mitchell and Christopher D. Manning and Dan Jurafsky and Chelsea Finn},
journal= {arXiv preprint arXiv:2211.14946},
year = {2023}
}
备注
v1 Presented at the First Workshop of Pre-training: Perspectives, Pitfalls, and Paths Forward (ICML, 2022) and New Frontiers in Adversarial Machine Learning Workshop (ICML, 2022); v2 Presented at the Sixth AAAI/ACM Conference on AI, Ethics, and Society (AIES, 2023)