探索大语言模型在古典语文学中的应用
计算与语言
2023-05-24 v1
摘要
NLP的最新进展催生了包括古希腊语和拉丁语在内的多种语言的强大语言模型。虽然先前关于古典语言的工作一致使用BERT,但在本工作中,我们创建了四个沿两个维度变化的古希腊语语言模型,以研究它们对古典语言相关任务的通用性:我们探索(i)仅编码器和编码器-解码器架构,使用RoBERTa和T5作为强模型类型,并为每种类型创建(ii)一个单语古希腊语实例和一个包含拉丁语与英语的多语实例。我们在形态和句法任务上评估所有模型,包括词形还原,这展示了T5解码能力的附加价值。我们进一步定义了两个探测任务,以研究在古典文本上预训练的模型所获得的知识。我们的实验提供了对现有古希腊语模型的首次基准分析。结果表明,我们的模型相比SOTA有显著提升。对模型类型的系统性分析可为未来设计古典语言语言模型的研究提供指导,包括开发新颖的生成任务。我们将所有模型作为社区资源发布,同时发布一个大型精选古希腊语预训练语料库,以支持创建用于古典语文学的更大、可比较的模型库。我们的模型和资源可在https://github.com/Heidelberg-NLP/ancient-language-models获取。
引用
@article{arxiv.2305.13698,
title = {Exploring Large Language Models for Classical Philology},
author = {Frederick Riemenschneider and Anette Frank},
journal= {arXiv preprint arXiv:2305.13698},
year = {2023}
}
备注
Paper accepted for publication at ACL 2023 Main; 10 pages, 7 appendix pages, 4 figures, 13 tables