通过识别语言模型嵌入中的线性毒性子空间实现简单文本解毒
计算与语言
2021-12-16 v1 机器学习
摘要
大型预训练语言模型常在大量互联网数据上训练,其中部分可能含有有毒或滥用语言。因此,语言模型编码了毒性信息,限制了这些语言模型在现实世界中的使用。当前方法旨在防止生成文本中出现毒性特征。我们假设预训练语言模型的潜空间中存在一个低维毒性子空间,其存在表明毒性特征遵循某种底层模式,因而可被移除。为构建该毒性子空间,我们提出一种推广潜空间中毒性方向的方法。我们还提供了一种利用基于上下文的词语掩码系统构建平行数据集的方法。通过实验,我们展示当从一组句子表示中移除毒性子空间后,结果中几乎不残留毒性表示。我们凭经验证明,用我们的方法发现的子空间可泛化至多个毒性语料库,表明低维毒性子空间的存在。
引用
@article{arxiv.2112.08346,
title = {Simple Text Detoxification by Identifying a Linear Toxic Subspace in Language Model Embeddings},
author = {Andrew Wang and Mohit Sudhakar and Yangfeng Ji},
journal= {arXiv preprint arXiv:2112.08346},
year = {2021}
}