中文

以细磨的牙签走遍精细网络:索引精细网络以进行有问题内容搜索与检索的技术报告

计算与语言 2025-09-01 v1 人工智能 信息检索

摘要

大型语言模型 (LLM) 高度依赖网络规模数据集如 Common Crawl,该数据集为某些现代模型的训练数据提供了超过 80%。然而,网络爬虞的非选择性本质在数据质量、安全和伦理方面引发了挑战。尽管训练数据质量的重要性已广为人知,但先前的有害内容研究受限于计算资源,仅涉及小样本。本项目提出了一个用于索引和分析 LLM 训练数据集的框架,基于 ElasticSearch 实现。我们将其应用于瑞士 AI 的 FineWeb-2 语料库 (1.5TB,四种语言),实现了快速查询性能——大多数搜索在毫秒级,所有搜索均在 2 秒内完成。我们的工作展示了实时数据集分析,提供了更安全、更具可解释性的 AI 系统的实用工具。

关键词

引用

@article{arxiv.2508.21788,
  title  = {Going over Fine Web with a Fine-Tooth Comb: Technical Report of Indexing Fine Web for Problematic Content Search and Retrieval},
  author = {Inés Altemir Marinas and Anastasiia Kucherenko and Andrei Kucharavy},
  journal= {arXiv preprint arXiv:2508.21788},
  year   = {2025}
}