迈向更安全的预训练:分析和过滤网络规模数据集中的有害内容以实现负责任的大语言模型
计算与语言
2025-08-14 v3 机器学习
摘要
大语言模型(LLMs)通过利用 Common Crawl、C4 和 FineWeb 等大规模网络来源数据集进行预训练,已成为各种现实应用不可或缺的一部分。虽然这些数据集提供了高质量自然语言生成所必需的语言数据,但它们通常包含有害内容,例如仇恨言论、错误信息和带有偏见的叙述。在此类未经过滤的数据上训练大语言模型,可能会延续有毒行为、传播错误信息并放大社会偏见,从而削弱人们对大语言模型驱动应用的信任,并引发关于其使用的伦理担忧。本文对这些数据集中的不当内容进行了大规模分析,提供了一个全面的分类法,根据其意图将有害网页分为主题性和毒性两类。我们还引入了一个提示评估数据集、一个高精度的主题性和毒性提示(TTP)以及一个基于 Transformer 的模型(HarmFormer)用于有害内容过滤。此外,我们创建了一个新的多危害开放式毒性基准(HAVOC),并提供了关于模型如何响应对抗性毒性输入的关键见解。我们分享了 TTP、TTP-Eval、HAVOC 以及经 HarmFormer 推理的 C4 样本。我们的工作为确保更安全的大语言模型预训练提供了见解,并可作为负责任人工智能(RAI)合规性的资源。
引用
@article{arxiv.2505.02009,
title = {Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs},
author = {Sai Krishna Mendu and Harish Yenala and Aditi Gulati and Shanu Kumar and Parag Agrawal},
journal= {arXiv preprint arXiv:2505.02009},
year = {2025}
}
备注
10 pages, 5 figures. Accepted at the International Joint Conferences on Artificial Intelligence IJCAI 2025 (main track)