基于标注文学方言语料库检验语言模型假设
计算与语言
2026-02-18 v1
摘要
我们提供了一个包含19世纪美国文学正字变体标记的数据集,新增了一层由人类标注的方言群组标签,旨在作为计算实验探索文学意义上的正字变体的基础。我们对该数据集使用基于token(BERT)和基于字符(CANINE)的上下文语言模型进行了一系列初始广泛实验。我们发现,刻意引入的"方言效应"通过多种语言学通道实现,并且这些通道能够在特定语言建模假设下呈现不同程度的表现。具体而言,我们发现分词方案的选择在模型能够表现出何种正字信息方面具有意义的影响。
引用
@article{arxiv.2410.02674,
title = {Examining Language Modeling Assumptions Using an Annotated Literary Dialect Corpus},
author = {Craig Messner and Tom Lippincott},
journal= {arXiv preprint arXiv:2410.02674},
year = {2026}
}
备注
Accepted to NLP4DH@EMNLP2024