中文

教会模型理解(但不生成)高风险数据

计算与语言 2025-10-16 v2 机器学习

摘要

语言模型开发者通常会从预训练数据中过滤掉高风险内容(如有毒或受版权保护的文本),以防止模型生成类似输出。然而,完全移除这些数据会限制模型识别并恰当回应有害或敏感内容的能力。本文提出了一种名为“选择性损失以理解但不生成”(Selective Loss to Understand but Not Generate, SLUNG)的预训练范式,通过该范式,模型学会理解高风险数据,而无需学习生成它们。SLUNG 并非统一应用下一词元预测损失,而是选择性地避免激励高风险词元的生成,同时确保它们保留在模型的上下文窗口内。当模型学习预测紧随高风险词元之后的低风险词元时,它被迫去理解高风险内容。通过实验,我们表明 SLUNG 持续提升了模型对高风险数据的理解能力(例如,识别有毒内容的能力),同时并未增加其生成(例如,模型回应的毒性)。总体而言,我们的 SLUNG 范式使模型能够从原本会被过滤掉的高风险文本中获益。

关键词

引用

@article{arxiv.2505.03052,
  title  = {Teaching Models to Understand (but not Generate) High-risk Data},
  author = {Ryan Wang and Matthew Finlayson and Luca Soldaini and Swabha Swayamdipta and Robin Jia},
  journal= {arXiv preprint arXiv:2505.03052},
  year   = {2025}
}