参与感削弱了安全性:刻板印象与有害内容如何塑造语言模型中的幽默
计算与语言
2025-10-22 v1
摘要
大型语言模型越来越多地用于创意写作和参与内容,引发了关于输出安全性的担忧。因此,将幽默生成作为测试场,本工作评估了在现代 LLM 流水线中,幽默优化如何与有害内容相耦合,方法是联合衡量幽默性、刻板印象和有害性。我们进一步通过信息论指标分析不一致信号。我们在六个模型中观察到,具有有害输出的幽默得分更高,在角色基础提示下进一步提高,这表明生成器和评估器之间存在偏好放大环路。信息论分析显示,有害线索扩大了预测不确定性,令人惊讶的是,甚至会使某些模型对具有有害笑点更具预期性,这表明这些有害笑点在学习的幽默分布中被结构性地嵌入。外部验证在额外的讽刺生成任务中进行,基于人类感知的幽默判断显示,LLM 讽刺作品增加了刻板印象和通常的有害性,包括封闭模型。定量上,刻板/有害的笑话在平均幽默得分上提高 10-21%,刻板笑话在 LLM 基于幽默的指标所标记的幽默笑话中出现频率提高 11% 到 28%,在人类感知为幽默的生成中出现频率提高最高可达 10%。
引用
@article{arxiv.2510.18454,
title = {Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models},
author = {Atharvan Dogra and Soumya Suvra Ghosal and Ameet Deshpande and Ashwin Kalyan and Dinesh Manocha},
journal= {arXiv preprint arXiv:2510.18454},
year = {2025}
}