从传统标注器到大语言模型:中世纪罗曼种语言POS标注的比较研究
计算与语言
2026-05-12 v1 人工智能
应用统计
摘要
中世纪罗曼种语言(part-of-speech, POS)标注由于拼写变体、形态复杂性和有限的标注资源而具有挑战性。本文系统评估了大语言模型(LLM)在中世纪Occitan、中世纪Catalan和中世纪French三种古典罗曼语方面的POS标注性能。我们将传统基于规则和统计的标注器与现代开源LLM进行比较,测试场景包括零shot prompting、few-shot prompting、monolingual fine-tuning和cross-lingual transfer learning。基于历史数据集的实验表明,LLM方法在所有情况下都优于传统标注器,尤其是fine-tuning和multilingual训练取得了最大的改进。在特定目标语言方面,cross-lingual transfer learning显著提升了资源匮乏的变体,而针对特定目标语言的双语训练可以优于更广泛的multilingual配置。结果凸显了在历史NLP中设计transfer策略时语言相似性和数据集特征的重要性。这些发现为将现代神经方法应用于古典文本处理提供了实证依据,并为在digital humanities研究中部署LLM-based POS标注管道提供了实用指导。我们发布了所有代码、模型和处理后的数据集,以保证可重复性。
引用
@article{arxiv.2605.09147,
title = {From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages},
author = {Matthias Schöffel and Esteban Garces Arias},
journal= {arXiv preprint arXiv:2605.09147},
year = {2026}
}
备注
Accepted at NLP4DH @ ACL 2026