中文

WanJuanSiLu:面向低资源语言的高质量开源网页文本数据集

计算与语言 2025-01-27 v1

摘要

本文介绍了开源数据集 WanJuanSiLu,旨在为低资源语言提供高质量训练语料,从而推动多语言模型的研究与开发。为实现此目标,我们开发了针对低资源语言的系统化数据处理框架。该框架涵盖数据提取、语料清洗、内容去重、安全过滤、质量评估和主题分类等关键环节。通过实施该框架,我们显著提升了数据集的质量和安全性,同时保持了其语言多样性。目前,该数据集涵盖的五种语言数据已全部开源。数据集可访问于 https://opendatalab.com/applyMultilingualCorpus,GitHub 仓库地址为 https://github.com/opendatalab/WanJuan3.0

关键词

引用

@article{arxiv.2501.14506,
  title  = {WanJuanSiLu: A High-Quality Open-Source Webtext Dataset for Low-Resource Languages},
  author = {Jia Yu and Fei Yuan and Rui Min and Jing Yu and Pei Chu and Jiayang Li and Wei Li and Ruijie Zhang and Zhenxiang Li and Zhifei Ren and Dong Zheng and Wenjian Zhang and Yan Teng and Lingyu Meng and ZhenJiang Jin and Jiantao Qiu and ShaSha Wang and Zhongying Tu and Dahua Lin and Yu Wang and Yu Qiao and Yanfeng Wang and Conghui He},
  journal= {arXiv preprint arXiv:2501.14506},
  year   = {2025}
}