中文

社交媒体多模态命名实体识别中的 TriMod 融合

信息检索 2025-01-15 v1 社会与信息网络

摘要

社交媒体平台作为用户生成内容的宝贵来源,提供了关于人类行为各方面的洞见。命名实体识别(NER)在分析此类内容方面发挥着关键作用,通过识别并将命名实体归类到预定义类别中。然而,传统 NER 模型常常难以应对社交媒体语言的非正式、稀疏语境和歧义性。为应对这些挑战,近期研究聚焦于多模态方法,利用文本和视觉线索实现更精准的实体识别。尽管已取得进展,现有方法仍在捕捉视觉对象与文本实体之间的细粒度映射以及解决模态间分布性差异方面存在局限。本文提出一种新方法,集成文本、视觉和 hashtag 特征(TriMod),利用 Transformer 注意力机制实现有效的模态融合。我们模型所体现的数据结构改进表明,命名实体极大受益于来自多模态上下文的辅助信息,从而实现更精准的识别。通过在多模态社交媒体数据集上进行实验,我们展示了该方法超越现有最先进方法的优势,在精确率、召回率和 F1 分数方面实现了显著提升。

关键词

引用

@article{arxiv.2501.08267,
  title  = {TriMod Fusion for Multimodal Named Entity Recognition in Social Media},
  author = {Mosab Alfaqeeh},
  journal= {arXiv preprint arXiv:2501.08267},
  year   = {2025}
}

备注

Accepted at CASCON