中文

用于零样本葡萄牙语命名实体识别的本地LLM集成

机器学习 2025-12-12 v1

摘要

大语言模型(LLM)通过上下文学习在许多自然语言处理(NLP)任务中表现出色,但在命名实体识别(NER)方面常常表现不佳,尤其是对于葡萄牙语等低资源语言。虽然开源权重LLM支持本地部署,但没有单一模型能主导所有任务,这促使了集成方法的探索。然而,现有的LLM集成主要聚焦于文本生成或分类,NER领域尚未得到充分探索。在此背景下,本工作提出了一种新颖的三步集成流水线,用于使用能力相似、可本地运行的LLM进行零样本NER。我们的方法通过一种启发式策略选择最优模型组合,仅需少量标注数据,在五个葡萄牙语NER数据集中的四个上优于单个LLM。此外,我们表明,在不同源数据集上获得的集成模型在跨数据集配置中通常优于单个LLM,可能消除了当前任务对标注数据的需求。我们的工作通过有效组合多个小型LLM而无需微调,推进了可扩展、低资源和零样本NER的发展。代码可在https://github.com/Joao-Luz/local-llm-ner-ensemble获取。

关键词

引用

@article{arxiv.2512.10043,
  title  = {Local LLM Ensembles for Zero-shot Portuguese Named Entity Recognition},
  author = {João Lucas Luz Lima Sarcinelli and Diego Furtado Silva},
  journal= {arXiv preprint arXiv:2512.10043},
  year   = {2025}
}