中文

现代模型,中世纪文本:古奥克西坦语的词性标注研究

计算与语言 2025-03-12 v1

摘要

大型语言模型(LLM)在自然语言处理方面已展现出卓越能力,但它们在处理历史语言方面的有效性仍 largely 未被探索。本研究考察了开源 LLM 在古奥克西坦语(一种以非标准化拼写和显著历时变异为特征的历史语言)上的词性标注(POS)性能。通过对两个不同语料库——圣徒传记文本与医学文本——的比较分析,我们评估了当前模型在处理低资源历史语言固有挑战时的表现。我们的发现揭示了 LLM 在面对极端拼写与句法变异时的关键局限性。我们提供了详细的错误分析以及提升模型在历史语言处理方面性能的具体建议。本研究推进了我们对 LLM 在挑战性语言语境下能力的理解,同时为计算语言学与历史语言研究提供了实用见解。

关键词

引用

@article{arxiv.2503.07827,
  title  = {Modern Models, Medieval Texts: A POS Tagging Study of Old Occitan},
  author = {Matthias Schöffel and Marinus Wiedner and Esteban Garces Arias and Paula Ruppert and Christian Heumann and Matthias Aßenmacher},
  journal= {arXiv preprint arXiv:2503.07827},
  year   = {2025}
}