KENGIC:基于关键词驱动与N元语法图的图像描述生成方法
计算机视觉与模式识别
2023-02-09 v1
摘要
本文提出一种基于关键词驱动与N元语法图的图像描述生成方法(KENGIC)。当前大多数最先进(SOTA)的图像描述生成器都是在大规模图像-描述配对数据集上端到端训练的,而这类数据集的收集非常费力且昂贵。此类模型在可解释性以及跨领域适用性方面存在局限。为应对这些局限,本文提出了一种基于N元语法图的简单模型,该模型无需在任何图像-描述配对数据上端到端训练。生成器以一组图像关键词作为节点,通过给定文本语料中重叠的n元语法将这些节点连接,从而构建有向图。随后,模型通过最大化所构建图中最可能的n元语法序列来推断描述。为分析该方法中关键词的使用与选择,本研究基于(a)从黄金标准描述中提取的关键词与(b)自动检测到的关键词,分析了图像描述的生成过程。定量与定性分析均证明了KENGIC的有效性。其性能非常接近当前在非配对设定下训练的最先进图像描述生成器。对该方法的分析还有助于揭示当前在配对设定下训练的性能最优描述生成器背后的生成过程,并进一步对自动图像描述中广泛使用的现有评估指标的局限性提供见解。
引用
@article{arxiv.2302.03729,
title = {KENGIC: KEyword-driven and N-Gram Graph based Image Captioning},
author = {Brandon Birmingham and Adrian Muscat},
journal= {arXiv preprint arXiv:2302.03729},
year = {2023}
}
备注
Published in the Digital Image Computing: Techniques and Applications, 2022 (DICTA 2022)