面向意第绪语的词性标注器
计算与语言
2023-08-21 v2
摘要
我们描述了意第绪语词性标注器的构建与评估。这是为语言学研究而自动为意第绪语文本分配词性标签与句法结构的大型项目的第一步。我们将两种资源用于当前工作——宾州历史意第绪语标注语料库(PPCHY)的 8 万词子集,以及来自意第绪语图书中心(YBC)的 6.5 亿词光学字符识别(OCR)意第绪语文本。YBC 语料库中的意第绪语正字法存在许多拼写不一致,我们提出一些证据表明,即便在 YBC 上训练的简单非上下文嵌入也能捕捉拼写变体间的关系,而无需先“标准化”语料库。我们还使用 YBC 对上下文嵌入进行继续预训练,随后将其整合进一个在 PPCHY 上训练并评估的标注器模型。我们在 10 折交叉验证划分上评估标注器性能,表明使用 YBC 文本获取上下文嵌入可提升标注器性能。最后我们讨论了若干后续步骤,包括需要额外的标注训练与测试数据。
引用
@article{arxiv.2204.01175,
title = {A Part-of-Speech Tagger for Yiddish},
author = {Seth Kulick and Neville Ryant and Beatrice Santorini and Joel Wallenberg and Assaf Urieli},
journal= {arXiv preprint arXiv:2204.01175},
year = {2023}
}