中文

乌尔德语多模态命名实体识别的基准数据集与框架

计算与语言 2025-05-09 v1

摘要

多模态内容,特别是社交媒体中的文本和图像的出现,使多模态命名实体识别 (MNER) 成为自然语言处理领域日益重要的研究方向。尽管在诸如英语等高资源语言方面取得了进展,但 MNER 在诸如乌尔德语等低资源语言上仍鲜有探索。主要挑战包括缺乏标注的多模态数据集和缺乏标准化的基线方法。为此,我们引入 U-MNER 框架并发布了Twitter2015-Urdu数据集,这是乌尔德语 MNER 的开创性资源。该数据集源自广泛使用的Twitter2015数据集,并依据乌尔德语语法规则进行标注。我们通过在该数据集上评估文本模型和多模态模型,建立了基准基线,提供比较分析,以支持未来在乌尔德语 MNER 方面的研究。U-MNER 框架集成了文本和视觉上下文,利用乌尔德语-BERT进行文本嵌入,利用ResNet进行视觉特征提取,并通过跨模态融合模块对齐和融合信息。我们的模型在Twitter2015-Urdu数据集上实现了最好的性能,为进一步开展低资源语言的 MNER 研究奠定了基础。

关键词

引用

@article{arxiv.2505.05148,
  title  = {A Benchmark Dataset and a Framework for Urdu Multimodal Named Entity Recognition},
  author = {Hussain Ahmad and Qingyang Zeng and Jing Wan},
  journal= {arXiv preprint arXiv:2505.05148},
  year   = {2025}
}

备注

16 pages, 5 figures. Preprint