FewTopNER:在多语言框架中集成小样本学习与主题建模和命名实体识别
计算与语言
2025-02-05 v1 人工智能
摘要
我们引入了 FewTopNER,这是一个新颖的框架,它将小样本命名实体识别(NER)与主题感知的上下文建模相集成,以应对跨语言和低资源场景的挑战。FewTopNER 利用基于 XLM-RoBERTa 的共享多语言编码器,并辅以语言特定的校准机制,以生成鲁棒的上下文嵌入。该架构包含一个基于原型的实体识别分支,采用 BiLSTM 和条件随机场进行序列标注,以及一个主题建模分支,通过混合概率和神经方法提取文档级语义特征。跨任务桥接促进了实体表示和主题表示之间的动态双向注意力和特征融合,从而通过整合全局语义上下文来增强实体消歧。在英语、法语、西班牙语、德语和意大利语的多语言基准上的实证评估表明,FewTopNER 显著优于现有最先进的小样本 NER 模型。特别是,该框架在 F1 分数上实现了 2.5-4.0 个百分点的提升,并在通过归一化点互信息衡量的主题连贯性方面表现出增强。消融研究进一步证实了共享编码器和跨任务集成机制对整体性能的关键贡献。这些结果强调了将主题感知上下文纳入小样本 NER 的有效性,并凸显了 FewTopNER 在低资源环境下进行鲁棒跨语言应用的潜力。
引用
@article{arxiv.2502.02391,
title = {FewTopNER: Integrating Few-Shot Learning with Topic Modeling and Named Entity Recognition in a Multilingual Framework},
author = {Ibrahim Bouabdallaoui and Fatima Guerouate and Samya Bouhaddour and Chaimae Saadi and Mohammed Sbihi},
journal= {arXiv preprint arXiv:2502.02391},
year = {2025}
}
备注
Code source : https://github.com/ibrahimself/FewTopNER/