不留下语言数据:Hugging Face 生态系统中CJK语言数据集的比较研究
计算与语言
2025-10-16 v3
摘要
自然语言处理(NLP)的近期进展凸显了高质量数据集在构建大型语言模型(LLMs)中的关键作用。然而,尽管英语已有大量资源和分析,东亚语言——尤其是中文、日文和韩文(CJK)——的数据集仍呈碎片化和不被充分探索的局面,尽管这些语言共计服务超过16亿使用者。为填补这一差距,我们从跨语言视角调查HuggingFace生态系统,重点关注如何影响数据集可用性和质量的文化规范、研究环境和制度实践。我们运用定量和定性方法,检验这些因素如何驱动中国、日文和韩文NLP社区中不同的数据集创建和策源模式。我们的发现突显了中国数据集的大规模和往往由机构驱动的特性,韩文NLP的草根社区主导开发,以及日文数据集以娱乐和亚文化为中心的强调。通过揭示这些模式,我们揭示了提高数据集文档、许可证清晰度和跨语言资源共享的实用策略——最终指导更有效和更符合文化敏感性的东亚地区LLM开发。我们 concludes by discussing best practices for future dataset curation and collaboration, aiming to strengthen resource development across all three languages.
引用
@article{arxiv.2507.04329,
title = {No Language Data Left Behind: A Comparative Study of CJK Language Datasets in the Hugging Face Ecosystem},
author = {Dasol Choi and Woomyoung Park and Youngsook Song},
journal= {arXiv preprint arXiv:2507.04329},
year = {2025}
}
备注
Accepted to EMNLP 2025 MRL Workshop