FAST:面向黑盒生成模型弱遗忘的特征感知相似度阈值化
机器学习
2024-06-21 v2 人工智能
摘要
在隐私问题与合规性要求日益增长的推动下,对深度生成模型的监管愈发受到重视,凸显了对这些模型实施精确控制机制的迫切需求。当生成模型生成包含不良、冒犯性或潜在有害内容的输出时,这种紧迫性尤为突出。作为应对,机器遗忘 应运而生,旨在选择性地遗忘特定知识或从预训练模型中消除不良数据子集的影响。然而,现代机器遗忘方法通常假设在遗忘过程中可以访问模型参数和架构细节,但这并不总是可行的。在众多下游任务中,这些模型作为黑盒系统运行,其预训练参数、架构和训练数据均不可访问。在这种情况下,过滤不良输出成为一种可行的替代方案。本研究的主要目标有两方面:首先,阐明过滤与遗忘过程之间的关系;其次,制定一种旨在减轻被归类为黑盒系统的模型所生成的不良输出的展示的方法论。本研究的理论分析表明,在黑盒模型的背景下,过滤可以被视为一种弱遗忘。我们提出的 \textbf{\textit{Feature Aware Similarity Thresholding (FAST)}} 方法通过在潜空间中系统编码不良特征的表示,有效地抑制了不良输出。
引用
@article{arxiv.2312.14895,
title = {FAST: Feature Aware Similarity Thresholding for Weak Unlearning in Black-Box Generative Models},
author = {Subhodip Panda and Prathosh AP},
journal= {arXiv preprint arXiv:2312.14895},
year = {2024}
}