什么对你来说是禁忌?——大语言模型对敏感内容行为的实证评估
计算与语言
2025-08-01 v1
摘要
专有大语言模型 (LLM) 表现出礼貌、正式以及隐式内容审查的倾向。尽管先前的研究主要集中在显式训练模型以审查和净化敏感内容,但对于 LLM 是否会在没有显式指令的情况下隐式净化语言,探索仍然有限。本研究实证分析了 GPT-4o-mini 在释义敏感内容时的隐式审查行为,并评估了敏感度变化的程度。我们的实验表明,GPT-4o-mini 系统性地将内容审查至敏感度较低的类别,大幅减少了贬损和禁忌语言。此外,我们评估了 LLM 在句子敏感度分类中的零样本能力,并将其性能与传统方法进行了比较。
引用
@article{arxiv.2507.23319,
title = {What's Taboo for You? - An Empirical Evaluation of LLMs Behavior Toward Sensitive Content},
author = {Alfio Ferrara and Sergio Picascia and Laura Pinnavaia and Vojimir Ranitovic and Elisabetta Rocchetti and Alice Tuveri},
journal= {arXiv preprint arXiv:2507.23319},
year = {2025}
}