中文

DCAD-2000:基于异常检测的数据清洗的 2000+ 语言多语言数据集

计算与语言 2025-10-27 v5

摘要

大型语言模型(LLM)的快速发展凸显了对高质量、多样且精心筛选的多语言数据集的需求。本文引入 DCAD-2000(Data Cleaning as Anomaly Detection),一个来自新抽取的 Common Crawl 数据及现有多语言资源构建的大规模多语言语料库。DCAD-2000 覆盖 2,282 种语言,包含 46.72TB 文本,8.63 亿篇文档,涵盖 155 种高资源和中等资源语言以及 159 种书写脚本。为克服现有数据清洗方法依赖人工设计阈值的局限性,我们将数据清洗重新定义为异常检测问题。这种动态过滤范式通过自动识别和移除噪声或异常内容,显著提升了数据质量。通过在 DCAD-2000 上微调 LLM,我们在数据质量、清洗管道的鲁棒性以及多语言基准测试中的下游性能方面均取得显著提升,尤其在面对低资源语言时效果尤为突出。

关键词

引用

@article{arxiv.2502.11546,
  title  = {DCAD-2000: A Multilingual Dataset across 2000+ Languages with Data Cleaning as Anomaly Detection},
  author = {Yingli Shen and Wen Lai and Shuo Wang and Xueren Zhang and Kangyang Luo and Alexander Fraser and Maosong Sun},
  journal= {arXiv preprint arXiv:2502.11546},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets and Benchmarks Track