中文

NER4all 还是 所谓 Context 才是关键:面向历史文本的LLM低成本高性能命名实体识别

计算与语言 2025-02-10 v1 人工智能

摘要

命名实体识别(NER)是历史研究中自动建立人物、地点、事件等参考信息的核心任务。然而,由于源文件的语言和体裁高度多样、拼写标准化有限、历史领域知识要求高以及标注训练数据的稀缺,传统的自然语言处理(NLP)方法在成本和效果上均不尽人意。本文提出了新方法。我们展示了 readily-available、领先的大语言模型(LLM)在历史文档NER中显著优于两个主流NLP框架spaCy和flair,F1分数提升7%-22%。我们的消融研究表明,为任务提供历史语境并辅以一点角色建模(persona modeling),使注意力从纯语言学方法转向更具实用性的策略,正是成功提示策略的关键。我们也证明了与预期相反的现象:在Few-shot方法中,提供更多示例(超过16-shot)并不提升召回率或精确率。基于此,本方法通过消除使用脚本语言和计算技能才能使用的传统NLP工具的障碍,借助自然语言提示和消费级工具/前端实现对历史学家的NER访问的民主化。

关键词

引用

@article{arxiv.2502.04351,
  title  = {NER4all or Context is All You Need: Using LLMs for low-effort, high-performance NER on historical texts. A humanities informed approach},
  author = {Torsten Hiltmann and Martin Dröge and Nicole Dresselhaus and Till Grallert and Melanie Althage and Paul Bayer and Sophie Eckenstaler and Koray Mendi and Jascha Marijn Schmitz and Philipp Schneider and Wiebke Sczeponik and Anica Skibba},
  journal= {arXiv preprint arXiv:2502.04351},
  year   = {2025}
}