中文

FineWeb-zhtw:面向繁体中文网页数据的可扩展精选

计算与语言 2024-11-26 v1 数据库

摘要

大型语言模型(LLM)的预训练数据质量和规模显著影响其性能。虽然为英语用户积极筛选此类数据集的努力已颇为频繁,但针对繁体中文的类似举措相对不足。基于FineWeb的基础上,我们引入FineWeb-zhtw,为繁体中文用户量身定制的数据集。我们构思了多个精心设计的过滤阶段,以适应英语与繁体中文之间的语言差异,确保数据的全面性和质量。我们通过查询数据集样本的三个主要目标来确定其有效性。我们的代码和数据集均公开可用。

关键词

引用

@article{arxiv.2411.16387,
  title  = {FineWeb-zhtw: Scalable Curation of Traditional Chinese Text Data from the Web},
  author = {Cheng-Wei Lin and Wan-Hsuan Hsieh and Kai-Xin Guan and Chan-Jan Hsu and Chia-Chen Kuo and Chuan-Lin Lai and Chung-Wei Chung and Ming-Jen Wang and Da-Shan Shiu},
  journal= {arXiv preprint arXiv:2411.16387},
  year   = {2024}
}