中文

优秀韩文NLP数据集综述

计算与语言 2022-11-29 v2 机器学习

摘要

基于英语的数据集通常可从Kaggle、GitHub或近期发表的论文中获取。尽管使用英文数据集的基准测试足以展示新模型与新方法的性能,但研究者仍需在基于韩语的数据集上训练和验证模型,以产出适用于韩语处理的技术或产品。本文介绍了15个流行的基于韩语的NLP数据集,并总结了其规模、许可证、代码库以及受这些数据集启发产生的其他研究成果等细节。此外,我提供了带有数据集样本或统计信息的高清晰度说明。数据集的主要特征以单一表格呈现,以便研究者快速概览数据集。

关键词

引用

@article{arxiv.2112.01624,
  title  = {A Survey on Awesome Korean NLP Datasets},
  author = {Byunghyun Ban},
  journal= {arXiv preprint arXiv:2112.01624},
  year   = {2022}
}

备注

11 pages, 1 horizontal page for large table