通过视觉实体增强与多粒度图像噪声过滤改进多模态关键词生成
计算机视觉与模式识别
2023-09-12 v1 计算与语言
多媒体
摘要
多模态关键词生成旨在产生一组代表输入文本-图像对核心要点关键词。在此方面,主流方法主要关注多模态融合以生成关键词。然而,仍存在两个主要缺陷:1)仅能利用有限来源(如图像描述)提供辅助信息。但它们可能不足以支撑后续关键词生成。2)输入文本与图像常非完美匹配,从而图像可能为模型引入噪声。为应对这些局限,本文提出一种新颖多模态关键词生成模型,其不仅以外部知识丰富模型输入,还有效过滤图像噪声。首先,我们引入图像的外部视觉实体作为模型补充输入,利于跨模态语义对齐以生成关键词。其次,我们同时计算图像-文本匹配分数与图像区域-文本相关分数,以执行多粒度图像噪声过滤。特别地,我们引入图像区域与真值关键词间的相关分数,以精炼前述相关分数的计算。为证明模型有效性,我们在基准数据集上进行了多组实验。实验结果及深入分析表明我们的模型取得了最先进(SOTA)性能。我们的代码见 https://github.com/DeepLearnXMU/MM-MKP。
引用
@article{arxiv.2309.04734,
title = {Towards Better Multi-modal Keyphrase Generation via Visual Entity Enhancement and Multi-granularity Image Noise Filtering},
author = {Yifan Dong and Suhang Wu and Fandong Meng and Jie Zhou and Xiaoli Wang and Jianxin Lin and Jinsong Su},
journal= {arXiv preprint arXiv:2309.04734},
year = {2023}
}
备注
Accepted In Proceedings of the 31st ACM International Conference on Multimedia (MM' 23)