M2D2:一个大规模多领域语言建模数据集
计算与语言
2022-10-17 v1
摘要
我们提出 M2D2,一个细粒度、大规模多领域语料库,用于研究语言模型(LMs)中的领域自适应。M2D2 包含 8.5B 词元,涵盖从 Wikipedia 和 Semantic Scholar 提取的 145 个领域。利用源自 Wikipedia 和 ArXiv 类别的本体,我们将每个数据源中的领域组织为 22 个组。这种两级层次结构使得研究领域之间的关系及其在自适应后对领域内和领域外性能的影响成为可能。我们还提出了若干关于 LMs 中有效领域自适应本质的见解,作为 M2D2 所支持的新型研究的示例。为提升领域内性能,我们展示了沿领域层次结构自适应 LM 的益处;相比于较大量的弱相关数据,自适应较小量的细粒度领域特定数据可带来更大的领域内性能提升。我们进一步展示了领域内专门化与领域外泛化之间在本体内部和跨本体的权衡,以及领域外性能与领域间词法重叠之间的强相关性。
引用
@article{arxiv.2210.07370,
title = {M2D2: A Massively Multi-domain Language Modeling Dataset},
author = {Machel Reid and Victor Zhong and Suchin Gururangan and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2210.07370},
year = {2022}
}
备注
EMNLP 2022