中文

图像描述生成器有时讲述多于其所见图像

计算机视觉与模式识别 2023-05-12 v2 多媒体

摘要

图像描述生成(image captioning),亦称“图像到文本”(image-to-text),从给定图像生成描述性文本,在深度学习时代迅速发展。由图像描述生成器生成的描述性文本在多大程度上保留了原始图像中的信息?为回答该问题,我们进行了仅从描述性文本(完全不参考图像)对图像进行分类的实验,并将结果与标准基于图像的分类器进行比较。我们针对灾难图像分类任务 CrisisNLP 评估了若干图像描述生成模型,并表明描述性文本分类器有时能取得比标准基于图像的分类器更高的准确率。此外,我们表明将基于图像的分类器与描述性文本分类器融合可提升准确率。

关键词

引用

@article{arxiv.2305.02932,
  title  = {Image Captioners Sometimes Tell More Than Images They See},
  author = {Honori Udo and Takafumi Koshinaka},
  journal= {arXiv preprint arXiv:2305.02932},
  year   = {2023}
}