FineWeb-zhtw:面向繁体中文网页数据的可扩展精选
计算与语言
2024-11-26 v1 数据库
摘要
大型语言模型(LLM)的预训练数据质量和规模显著影响其性能。虽然为英语用户积极筛选此类数据集的努力已颇为频繁,但针对繁体中文的类似举措相对不足。基于FineWeb的基础上,我们引入FineWeb-zhtw,为繁体中文用户量身定制的数据集。我们构思了多个精心设计的过滤阶段,以适应英语与繁体中文之间的语言差异,确保数据的全面性和质量。我们通过查询数据集样本的三个主要目标来确定其有效性。我们的代码和数据集均公开可用。
引用
@article{arxiv.2411.16387,
title = {FineWeb-zhtw: Scalable Curation of Traditional Chinese Text Data from the Web},
author = {Cheng-Wei Lin and Wan-Hsuan Hsieh and Kai-Xin Guan and Chan-Jan Hsu and Chia-Chen Kuo and Chuan-Lin Lai and Chung-Wei Chung and Ming-Jen Wang and Da-Shan Shiu},
journal= {arXiv preprint arXiv:2411.16387},
year = {2024}
}