增强低上下文情境下的印地语命名实体识别:基于Transformer模型的带无检索增强与无检索增强比较研究
计算与语言
2025-07-23 v1 人工智能
摘要
自然语言处理中的一个重要挑战是命名实体识别(NER),它用于识别和分类文本输入中的命名实体。为了提高NER性能,本研究探讨了一种利用印地语特定预训练编码器(MuRIL 和 XLM-R)以及生成模型(Llama-2-7B-chat-hf(Llama2-7B)、Llama-2-70B-chat-hf(Llama2-70B)、Llama-3-70B-Instruct(Llama3-70B)和 GPT3.5-turbo)进行的印地语NER技术,并通过检索来自维基百科等外部相关上下文的数据进行增强。我们对MuRIL、XLM-R 和 Llama2-7B进行了带无检索增强和无检索增强的微调。然而,Llama2-70B、lama3-70B 和 GPT3.5-turbo 用于少样本NER生成。我们的研究表明,带有检索增强(RA)的所提及语言模型(LMs)在大多数情况下均优于不包含RA的基线方法。MuRIL 和 XLM-R 在无RA时分别获得了0.69和0.495的宏平均F1分数,而在有RA时分别提升至0.70和0.71。微调后的Llama2-7B显著优于未微调的Llama2-7B。相反,未微调的生成模型在增强数据上也表现更好。GPT3.5-turbo 有效采用了RA;然而,Llama2-70B 和 llama3-70B 在我们的检索上下文中未能采用RA。这些发现表明,RA在提高低上下文数据性能方面具有显著作用。本研究为如何最佳地使用数据增强方法和预训练模型来增强NER性能,特别是在资源有限的语言方面,添加了重要知识。
引用
@article{arxiv.2507.16002,
title = {Enhancing Hindi NER in Low Context: A Comparative study of Transformer-based models with vs. without Retrieval Augmentation},
author = {Sumit Singh and Rohit Mishra and Uma Shanker Tiwary},
journal= {arXiv preprint arXiv:2507.16002},
year = {2025}
}