中文

使用大语言模型为多语言历史 NLP 生成准确标签

计算与语言 2025-11-19 v1 人工智能

摘要

历史和低资源 NLP 挑战在于数据有限且与现代网络语料库之间存在领域差异。本文概述了我们利用大语言模型(LLM)为历史法语(16至20世纪)和中国(1900至1950年)文本创建准确标签的工作。通过利用 LLM 在语料库子集上生成的准确标签,我们能够对 spaCy 进行微调,在时期特定的测试中实现了对词性标注、词形还原和命名实体识别(NER)的显著提升。我们的结果凸显了特定领域模型的重要性,并表明即使是有限的合成数据也能提高面向计算人文研究中资源不足语料库的 NLP 工具。

关键词

引用

@article{arxiv.2511.14688,
  title  = {Ground Truth Generation for Multilingual Historical NLP using LLMs},
  author = {Clovis Gladstone and Zhao Fang and Spencer Dean Stewart},
  journal= {arXiv preprint arXiv:2511.14688},
  year   = {2025}
}

备注

13 pages, 5 tables, 1 figure