中文

EAMA:基于实体感知多模态对齐的新闻图像描述方法

计算机视觉与模式识别 2024-09-23 v5 计算与语言

摘要

新闻图像描述要求模型结合新闻图像及相关新闻文章,生成富含实体信息的描述性标题。当前的多模态大语言模型(MLLMs)在处理新闻图像描述任务中的实体信息方面仍存在局限性。此外,生成高质量的新闻图像描述需要在文本输入信息的充分性与简洁性之间取得平衡。为了探索 MLLMs 的潜力并解决我们发现的问题,我们提出了 EAMA:一种基于实体感知多模态对齐的新闻图像描述方法。我们的方法首先通过两个额外的对齐任务——实体感知句子选择任务和实体选择任务——结合新闻图像描述任务,使 MLLM 实现对齐。对齐后的 MLLM 将利用其自身提取的额外实体相关信息,在生成新闻图像描述时补充文本输入。我们的方法在两个主流新闻图像描述数据集上取得了优于所有先前模型的结果。

关键词

引用

@article{arxiv.2402.19404,
  title  = {EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning},
  author = {Junzhe Zhang and Huixuan Zhang and Xunjian Yin and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2402.19404},
  year   = {2024}
}