中文

公地之毒:开源预训练数据的筛选

计算与语言 2024-11-19 v2

摘要

开源大语言模型在研究人员和从业者中正变得越来越普及和流行。虽然开放权重模型取得了显著进展,但开放训练数据仍是领先的开放权重模型创建者尚未采用的实践。与此同时,研究人员正在努力使语言模型更安全。我们提出了一种数据筛选流程,以减少基于公共领域数据训练的模型产生的有害输出。处理公共领域数据面临独特的挑战,因为这些来源在形式和内容上都与网络文本不同。许多来源是历史文档,并且是光学字符识别(OCR)的结果。因此,当前最先进的毒性过滤方法对于开放数据模型通常不可行或不适用。在本文中,我们引入了一个全新的、完全开源的开放数据毒性过滤流程。我们的贡献有三方面。我们创建了一个定制的训练数据集 ToxicCommons,该数据集由根据五个不同维度(基于种族/血统、性别、宗教、能力的歧视以及暴力)分类的文本组成。我们使用该数据集训练了一个定制的分类器 Celadon,该分类器可用于更高效、更大规模地检测开放数据中的有毒内容。最后,我们描述了一种平衡的内容过滤方法,该方法在安全过滤与可用于训练的过滤后数据量之间进行了优化。

关键词

引用

@article{arxiv.2410.22587,
  title  = {Toxicity of the Commons: Curating Open-Source Pre-Training Data},
  author = {Catherine Arnett and Eliot Jones and Ivan P. Yamshchikov and Pierre-Carl Langlais},
  journal= {arXiv preprint arXiv:2410.22587},
  year   = {2024}
}