中文

利用基于 Transformer 的框架通过深度信息增强图像描述

计算机视觉与模式识别 2023-08-09 v1 人工智能 计算与语言 图像与视频处理

摘要

图像描述是一项连接计算机视觉与自然语言处理的具有挑战性的场景理解任务。尽管图像描述模型已成功生成出色的描述,该领域主要聚焦于为 2D 图像生成单句描述。本文研究融合深度信息与 RGB 图像是否能增强描述任务并生成更好的描述。为此,我们提出一种基于 Transformer 的编码器-解码器框架,用于生成 3D 场景的多句描述。RGB 图像及其对应的深度图作为我们框架的输入,框架将二者结合以更好地理解输入场景。深度图可以是真实值或估计值,这使得我们的框架广泛适用于任何 RGB 描述数据集。我们探索了不同的融合方法来融合 RGB 与深度图像。实验在 NYU-v2 数据集和 Stanford 图像段落描述数据集上进行。在处理 NYU-v2 数据集时,我们发现不一致的标注阻碍了利用深度信息增强描述任务的益处,结果甚至比仅使用 RGB 图像更差。因此,我们提出了更一致且信息更丰富的 NYU-v2 数据集清洗版本。我们在两个数据集上的结果表明,所提框架有效利用了深度信息(无论是真实值还是估计值)并生成更好的描述。代码、预训练模型以及 NYU-v2 数据集的清洗版本将公开提供。

关键词

引用

@article{arxiv.2308.03767,
  title  = {Enhancing image captioning with depth information using a Transformer-based framework},
  author = {Aya Mahmoud Ahmed and Mohamed Yousef and Khaled F. Hussain and Yousef Bassyouni Mahdy},
  journal= {arXiv preprint arXiv:2308.03767},
  year   = {2023}
}

备注

19 pages, 5 figures, 13 tables