中文

困惑于质量:一种基于困惑度的多语言异构网络数据中成人内容与有害内容检测方法

计算与语言 2022-12-21 v1

摘要

随着当前最先进语言模型规模的增大,对大型语料库的需求日益增加,将网络数据作为这些模型预训练语料库的主要部分已成为一种普遍做法。这反过来给自然语言处理(NLP)从业者带来了一个重要挑战,因为他们现在面临着开发高度优化的模型和流水线以预处理大量文本数据的任务,这意味着要在网络规模上有效地分类和过滤多语言、异构且充满噪声的数据。大型语言模型预训练语料库这一预处理步骤的主要组成部分之一是去除成人内容和有害内容。在本文中,我们探讨了在多语言异构网络数据中检测成人内容和有害内容的不同方法。我们首先展示了传统的有害内容检测方法,这些方法看似在小规模和专用数据集上表现良好,但在面对异构噪声网络数据时迅速失效。然后我们求助于使用基于困惑度的方法,但做了一个改变:不是使用所谓的“干净”语料库来训练一个小型语言模型,然后使用困惑度来选择具有低困惑度的文档,即最类似于这个所谓“干净”语料库的文档。我们仅使用成人内容和有害文本数据进行训练,然后选择困惑度值高于给定阈值的文档。这种方法实际上将我们的文档聚类为两个不同的组,这将极大地促进困惑度阈值的选择,并使我们能够获得比传统分类方法更高的成人内容和有害内容检测精度。

关键词

引用

@article{arxiv.2212.10440,
  title  = {Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data},
  author = {Tim Jansen and Yangling Tong and Victoria Zevallos and Pedro Ortiz Suarez},
  journal= {arXiv preprint arXiv:2212.10440},
  year   = {2022}
}

备注

14 pages, 2 figures