超越单一方案:基于情境学习的个性化有害内容检测
计算与语言
2025-11-11 v1
摘要
有害在线内容(如有毒性、垃圾信息和负面情感)的不断扩散,对健全且可适应的监管系统提出了挑战。然而,现有的监管系统是集中式的且特定于任务的,透明度有限,忽视了不同用户偏好——这种方法不适用于隐私敏感或去中心化的环境。我们提出了一种新框架,利用情境学习(ICL)与基础模型统一检测有毒性、垃圾信息和负面情感,涵盖二分类、多分类和多标签设置。关键的是,我们的方法实现了轻量级个性化,允许用户通过简单的提示干预来轻松屏蔽新类别、解除现有屏蔽,或通过语义变体扩展检测——无需模型重新训练。在公共基准(TextDetox、UCI SMS、SST2)和一个新的标注后的 Mastodon 数据集上进行大规模实验,结果显示:(i)基础模型在跨任务泛化方面表现出色,常常匹配或优于特定任务微调的模型;(ii)仅需一个用户提供的示例或定义即可实现有效的个性化;(iii)通过在提示中添加标签定义或理由显著增强了对噪声数据和真实世界数据的鲁棒性。我们的工作确立了超越单一方案的监管,确立了ICL作为下一代用户中心内容安全系统的实用、隐私保留且高度可适应的路径。为促进可重复性并促进未来研究,我们在GitHub 上公开代码,并在 Hugging Face 上发布标注后的 Mastodon 数据集。
引用
@article{arxiv.2511.05532,
title = {Beyond One-Size-Fits-All: Personalized Harmful Content Detection with In-Context Learning},
author = {Rufan Zhang and Lin Zhang and Xianghang Mi},
journal= {arXiv preprint arXiv:2511.05532},
year = {2025}
}