GlossLM:用于行间词汇标注文本的大规模多语料库与预训练模型
计算与语言
2024-11-14 v3
摘要
语言记录项目通常涉及以行间词汇标注文本(IGT)等格式创建标注文本,该格式以逐语素的形式捕捉细粒度的形态句法分析。然而,目前很少有资源能提供大量标准化且易于获取的 IGT 数据,这限制了其在语言学研究中的适用性,也使得在 NLP 建模中难以使用此类数据。我们从各种来源编译了目前最大的 IGT 数据语料库,涵盖 1.8k 种语言的超过 45 万个样本,以促进跨语言迁移和 IGT 生成的研究。我们将大部分数据标准化,以遵循跨语言的统一标签集。此外,我们探索了自动生成 IGT 的任务,以辅助记录项目。由于许多语言缺乏足够的单语数据,我们在我们的语料库上预训练了一个大型多语言模型。我们通过在单语语料库上微调该模型展示了其实用性,其性能比 SOTA 模型高出 6.6%。我们的预训练模型和数据集可在 Hugging Face 上获取。
引用
@article{arxiv.2403.06399,
title = {GlossLM: A Massively Multilingual Corpus and Pretrained Model for Interlinear Glossed Text},
author = {Michael Ginn and Lindia Tjuatja and Taiqi He and Enora Rice and Graham Neubig and Alexis Palmer and Lori Levin},
journal= {arXiv preprint arXiv:2403.06399},
year = {2024}
}
备注
EMNLP 2024. First two authors are equal contribution