中文

CMNER:基于社交媒体的中文多模态命名实体识别数据集

计算与语言 2024-03-04 v2

摘要

多模态命名实体识别(MNER)是一项关键任务,旨在相关图像的支持下从文本中提取命名实体。然而,中文 MNER 数据的显著匮乏在很大程度上阻碍了该自然语言处理任务在中文领域的进展。因此,在本研究中,我们利用来自中国最大社交媒体平台微博的数据,构建了一个中文多模态命名实体识别数据集(CMNER)。我们的数据集包含 5,000 条微博帖子及 18,326 张对应图像。实体被划分为四个不同类别:人物、地点、组织和杂项。我们在 CMNER 上进行了基线实验,结果突出了引入图像对 NER 的有效性。此外,我们在公开可用的英文 MNER 数据集(Twitter2015)上进行了跨语言实验,结果证实了我们的假设,即中文和英文多模态 NER 数据可以相互增强 NER 模型的性能。

关键词

引用

@article{arxiv.2402.13693,
  title  = {CMNER: A Chinese Multimodal NER Dataset based on Social Media},
  author = {Yuanze Ji and Bobo Li and Jun Zhou and Fei Li and Chong Teng and Donghong Ji},
  journal= {arXiv preprint arXiv:2402.13693},
  year   = {2024}
}