中文

面向大语言模型安全与内容审核的半监督学习

计算与语言 2025-12-25 v1 人工智能 机器学习

摘要

大语言模型 (LLMs) 的安全问题自其出现以来一直是持续的研究焦点,并且随着这些模型能力的不断增强,如今变得更加重要。目前,所有公开的 LLM 都设有若干防护措施,并且存在多个用于训练安全分类器的提议数据集。然而,训练这些安全分类器依赖于大量标注数据,这些数据可能难以获取、容易出错,或常常包含合成数据。为了解决这些问题,我们提出了一种不同的方法:利用半监督学习技术,同时利用标注和未标注数据,来提高安全任务的性能。我们分析了这些技术能为提供给大语言模型的提示词以及对这些请求的响应带来的改进。此外,由于数据增强是半监督算法的核心部分,我们证明了使用任务特定增强的重要性,与通用增强技术相比,这能显著提高性能。

关键词

引用

@article{arxiv.2512.21107,
  title  = {Semi-Supervised Learning for Large Language Models Safety and Content Moderation},
  author = {Eduard Stefan Dinuta and Iustin Sirbu and Traian Rebedea},
  journal= {arXiv preprint arXiv:2512.21107},
  year   = {2025}
}