中文

UniDetox:通过数据蒸馏实现大型语言模型的通用去宣化

计算与语言 2025-04-30 v1 机器学习

摘要

我们提出 UniDetox,一种通用且可适用于各种大型语言模型(LLMs)的去宣化方法。以往的去宣化方法通常针对特定模型,仅能处理单个模型或模型家族,需因去宣化效果与语言建模性能之间的权衡而谨慎调参。相比之下,UniDetox 提供一种可被广泛应用于宽范围 LLMs 的去宣化技术,无需针对不同模型进行独立的模型特定调参。具体而言,我们提出了一种用于去宣化的新型且高效的数据蒸馏技术,采用对抗解码(contrastive decoding)。该方法以合成文本数据的形式蒸馏去宣化表征,使通过蒸馏文本进行的微调能够对任意 LLM 实现通用去宣化。我们的实验表明, 从 GPT-2 蒸馏的去宣化文本能够有效去宣化更大的模型,包括 OPT、Falcon 和 LLaMA-2。此外,UniDetox 消除了对每个模型独立调参的需求,无需为不同模型设置不同的超参数。进一步地,对去宣化文本的分析揭示了其对减少政治偏见内容的贡献,为理解 LLM 有效去宣化所必需属性提供了洞见。

关键词

引用

@article{arxiv.2504.20500,
  title  = {UniDetox: Universal Detoxification of Large Language Models via Dataset Distillation},
  author = {Huimin Lu and Masaru Isonuma and Junichiro Mori and Ichiro Sakata},
  journal= {arXiv preprint arXiv:2504.20500},
  year   = {2025}
}

备注

Accepted at ICLR 2025 (poster)