乌尔德语多模态命名实体识别的基准数据集与框架
计算与语言
2025-05-09 v1
摘要
多模态内容,特别是社交媒体中的文本和图像的出现,使多模态命名实体识别 (MNER) 成为自然语言处理领域日益重要的研究方向。尽管在诸如英语等高资源语言方面取得了进展,但 MNER 在诸如乌尔德语等低资源语言上仍鲜有探索。主要挑战包括缺乏标注的多模态数据集和缺乏标准化的基线方法。为此,我们引入 U-MNER 框架并发布了Twitter2015-Urdu数据集,这是乌尔德语 MNER 的开创性资源。该数据集源自广泛使用的Twitter2015数据集,并依据乌尔德语语法规则进行标注。我们通过在该数据集上评估文本模型和多模态模型,建立了基准基线,提供比较分析,以支持未来在乌尔德语 MNER 方面的研究。U-MNER 框架集成了文本和视觉上下文,利用乌尔德语-BERT进行文本嵌入,利用ResNet进行视觉特征提取,并通过跨模态融合模块对齐和融合信息。我们的模型在Twitter2015-Urdu数据集上实现了最好的性能,为进一步开展低资源语言的 MNER 研究奠定了基础。
引用
@article{arxiv.2505.05148,
title = {A Benchmark Dataset and a Framework for Urdu Multimodal Named Entity Recognition},
author = {Hussain Ahmad and Qingyang Zeng and Jing Wan},
journal= {arXiv preprint arXiv:2505.05148},
year = {2025}
}
备注
16 pages, 5 figures. Preprint