中文

从传统标注器到大语言模型:中世纪罗曼种语言POS标注的比较研究

计算与语言 2026-05-12 v1 人工智能 应用统计

摘要

中世纪罗曼种语言(part-of-speech, POS)标注由于拼写变体、形态复杂性和有限的标注资源而具有挑战性。本文系统评估了大语言模型(LLM)在中世纪Occitan、中世纪Catalan和中世纪French三种古典罗曼语方面的POS标注性能。我们将传统基于规则和统计的标注器与现代开源LLM进行比较,测试场景包括零shot prompting、few-shot prompting、monolingual fine-tuning和cross-lingual transfer learning。基于历史数据集的实验表明,LLM方法在所有情况下都优于传统标注器,尤其是fine-tuning和multilingual训练取得了最大的改进。在特定目标语言方面,cross-lingual transfer learning显著提升了资源匮乏的变体,而针对特定目标语言的双语训练可以优于更广泛的multilingual配置。结果凸显了在历史NLP中设计transfer策略时语言相似性和数据集特征的重要性。这些发现为将现代神经方法应用于古典文本处理提供了实证依据,并为在digital humanities研究中部署LLM-based POS标注管道提供了实用指导。我们发布了所有代码、模型和处理后的数据集,以保证可重复性。

关键词

引用

@article{arxiv.2605.09147,
  title  = {From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages},
  author = {Matthias Schöffel and Esteban Garces Arias},
  journal= {arXiv preprint arXiv:2605.09147},
  year   = {2026}
}

备注

Accepted at NLP4DH @ ACL 2026