中文

探索领域自适应训练用于大规模语言模型去毒化的极限

计算与语言 2022-10-25 v3 人工智能 计算机与社会 机器学习

摘要

预训练语言模型(LM)被证明容易生成有毒语言。本工作中,我们系统地探索领域自适应训练以降低语言模型的毒性。我们从三个维度开展研究:训练语料、模型规模与参数效率。对于训练语料,我们提出利用 LM 的生成能力来生成无毒数据集用于领域自适应训练,这缓解了暴露偏差,并且相比使用精选的预训练语料显示出更高的数据效率。我们证明,即使在训练语料少 1/3 的情况下,自生成方法在自动与人工评估的各种模型规模上均持续优于现有基线。随后我们全面研究了参数规模从 126M 到 530B(比 GPT-3 大 3 倍)的 LM 去毒化,这一规模此前从未被研究过。我们发现:i) 在相同预训练语料下,大 LM 与较小 LM 毒性水平相近;ii) 大 LM 需要更多努力去毒化。我们还探索了用于去毒化的参数高效训练方法。我们证明,在 LM 中添加并仅训练适配器(adapter)层不仅节省大量参数,而且相比全模型自适应在毒性与困惑度之间实现了更好的权衡(针对大规模模型)。

关键词

引用

@article{arxiv.2202.04173,
  title  = {Exploring the Limits of Domain-Adaptive Training for Detoxifying Large-Scale Language Models},
  author = {Boxin Wang and Wei Ping and Chaowei Xiao and Peng Xu and Mostofa Patwary and Mohammad Shoeybi and Bo Li and Anima Anandkumar and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2202.04173},
  year   = {2022}
}

备注

NeurIPS 2022