揭示2022年ACL和EMNLP会议数据集中的趋势
计算与语言
2024-07-16 v2 机器学习
摘要
自Transformer架构出现以来,自然语言处理(NLP)取得了显著发展。Transformer催生了预训练大语言模型(PLM)。NLP系统在多项任务上的性能有了巨大提升。在某些任务上,NLP系统已达到甚至超越人类水平。然而,一个常态是:\emph{预训练时更高质量的数据集能使PLM获得更好的性能,无论任务如何。}对高质量数据集的需求促使NLP研究人员不断创建新数据集以满足特定需求。例如,两个顶级NLP会议ACL和EMNLP在2022年接收了92篇引入新数据集的论文。本工作旨在揭示这些数据集中蕴含的趋势和见解。此外,我们为未来有兴趣整理数据集的研究人员提供了有价值的建议。
引用
@article{arxiv.2404.08666,
title = {Revealing Trends in Datasets from the 2022 ACL and EMNLP Conferences},
author = {Jesse Atuhurra and Hidetaka Kamigaito},
journal= {arXiv preprint arXiv:2404.08666},
year = {2024}
}