DAPI:面向细粒度去有害化的领域自适应有害探测向量干预
计算与语言
2025-03-18 v1 机器学习
摘要
过去的研究尝试利用线性探针进行去有害化,现有研究依赖单一有害探针向量以降低有害内容。然而,有害内容可细分为各种子类,通过单一有害探针向量难以去除某些类型的有害内容。为解决这一局限性,我们提出了基于类别的有害探针向量方法。首先,我们为不同的有害类别训练多个有害探针向量。在生成过程中,我们根据当前上下文动态选择最相关的有害探针向量。最后,对选定的向量进行动态比例缩放并从模型中减去。我们的方法成功地减轻了单一探针方法未能去除的有害类别。实验表明,我们的方法在评估数据集上实现了最高达 78.52% 的有害内容降低,同时保持了几乎不变的流畅度,仅比未受干预的模型下降了 0.052%。
引用
@article{arxiv.2503.12882,
title = {DAPI: Domain Adaptive Toxicity Probe Vector Intervention for Fine-Grained Detoxification},
author = {Cho Hyeonsu and Dooyoung Kim and Youngjoong Ko},
journal= {arXiv preprint arXiv:2503.12882},
year = {2025}
}
备注
10 pages, 3 figures