面向代码混合命名实体识别的预训练 BERT 与大语言模型比较研究
计算与语言
2025-09-03 v1 机器学习
摘要
代码混合文本的命名实体识别(NER),尤其是印地语-英语(Hinglish)文本,由于非正式结构、音译以及频繁语言切换,呈现独特挑战。本研究对代码混合微调模型和非代码混合多语言模型,以及零样本生成式大语言模型(LLM)进行比较评估。具体而言,我们评估了在代码混合数据上训练的 HingBERT、HingMBERT 和 HingRoBERTa(训练于代码混合数据),以及 BERT Base Cased、IndicBERT、RoBERTa 和 MuRIL(训练于非代码混合多语言数据)。我们还评估了 Google Gemini 在使用移除了 NER 标签的修改数据集上的零样本设置下的性能。所有模型都在基准 Hinglish NER 数据集上进行测试,使用精确率、召回率和 F1 分数。结果显示,代码混合模型,特别是 HingRoBERTa 和 HingBERT 系列在微调后模型,表现优于其他模型——包括闭源大语言模型如 Google Gemini——由于领域特定的预训练。非代码混合模型表现尚可,但适应性有限。值得注意的是,Google Gemini 在零样本设置下展现出竞争性能,凸显了现代大语言模型的泛化能力。本研究为代码混合 NER 任务中专业模型与通用模型的有效性提供了关键见解。
引用
@article{arxiv.2509.02514,
title = {Comparative Study of Pre-Trained BERT and Large Language Models for Code-Mixed Named Entity Recognition},
author = {Mayur Shirke and Amey Shembade and Pavan Thorat and Madhushri Wagh and Raviraj Joshi},
journal= {arXiv preprint arXiv:2509.02514},
year = {2025}
}