中文

Dynaword:从一次性到持续开发的数据集

计算与语言 2025-08-06 v2 人工智能

摘要

大规模数据集是自然语言处理研究和开发的基石,但当前方法面临三个关键挑战:(1) 依赖含义模糊的许可来源限制其使用、共享和衍生作品;(2) 静态数据集发布阻碍社区贡献并削弱数据集的生命周期;(3) 质量保证流程仅限于发布团队,无法发挥社区专业知识的作用。为此,我们提出两项贡献:Dynaword 方法和 Danish Dynaword。Dynaword 方法是一个能够通过社区协作持续更新的大规模开放数据集框架。Danish Dynaword 是该方法的具体实现,验证了其潜力并展示了其价值。Danish Dynaword 包含与其他发行版的四倍以上 token 数,完全采用开放许可证,并已在产业界和科研界获得多次贡献。该仓库包含轻量级测试,以确保数据格式、质量和文档,建立起持续社区贡献和数据集演化的可持续框架。

关键词

引用

@article{arxiv.2508.02271,
  title  = {Dynaword: From One-shot to Continuously Developed Datasets},
  author = {Kenneth Enevoldsen and Kristian Nørgaard Jensen and Jan Kostkan and Balázs Szabó and Márton Kardos and Kirten Vad and Johan Heinsen and Andrea Blasi Núñez and Gianluca Barmina and Jacob Nielsen and Rasmus Larsen and Peter Vahlstrup and Per Møldrup Dalum and Desmond Elliott and Lukas Galke and Peter Schneider-Kamp and Kristoffer Nielbo},
  journal= {arXiv preprint arXiv:2508.02271},
  year   = {2025}
}