刻画生成式大型语言模型中的有害内容
计算与语言
2026-01-13 v1 人工智能
摘要
近年来,注意力机制的出现显著推动了自然语言处理 (NLP) 领域的发展, revolutionizes 文本处理和文本生成。这得益于基于转换器的解码器-only 架构在 NLP 中变得无处不在,凭借其惊人的文本处理和生成能力。尽管有了这些突破,语言模型 (LM) 仍然容易生成不需要的输出:不恰当的、冒犯的或其他有害的响应。我们将这些统称为“有害”输出。虽然开发了强化学习从人类反馈 (RLHF) 等方法来将模型输出与人类价值观对齐,但这些安全措施常常能通过精心设计的提示词被规避。因此,本文考察了大型语言模型在提示下生成有害内容的程度,以及影响其生成此类输出的语言因素——包括词汇和句法——。
引用
@article{arxiv.2601.06700,
title = {Characterising Toxicity in Generative Large Language Models},
author = {Zhiyao Zhang and Yazan Mash'Al and Yuhan Wu},
journal= {arXiv preprint arXiv:2601.06700},
year = {2026}
}