中文

揭示提升 POS 标注的因素:低资源中世纪罗曼语研究

计算与语言 2025-06-24 v1 机器学习

摘要

词性 (POS) 标注仍然是自然语言处理流程中的基础组件,对于处于计算语言学和数字人文交叉领域的历史文本分析尤为关键。尽管现代大型语言模型 在古代语言方面取得了重大进展,但它们在中世纪罗曼语中的应用面临着独特的挑战,这些挑战源于历时语言学演变、拼写变异和标注数据稀缺。本研究系统地调查了涵盖圣经、圣徒传记、医学和饮食领域的中世纪奥克语、中世纪西班牙语和中世纪法语语料库中 POS 标注性能的核心决定因素。通过严格的实验,我们评估了微调方法、提示工程、模型架构、解码策略和跨语言迁移学习技术如何影响标注准确性。我们的结果既揭示了 LLM 在处理历史语言变体和非标准化拼写方面的显著局限性,也揭示了能够有效应对低资源历史语言所呈现独特挑战的有前景的专门技术。

关键词

引用

@article{arxiv.2506.17715,
  title  = {Unveiling Factors for Enhanced POS Tagging: A Study of Low-Resource Medieval Romance Languages},
  author = {Matthias Schöffel and Esteban Garces Arias and Marinus Wiedner and Paula Ruppert and Meimingwei Li and Christian Heumann and Matthias Aßenmacher},
  journal= {arXiv preprint arXiv:2506.17715},
  year   = {2025}
}