真实世界图像描述与场景识别的综合分析
计算机视觉与模式识别
2023-08-08 v1
摘要
图像描述(image captioning)是一项计算机视觉任务,涉及为图像生成自然语言描述。该方法在包括图像检索系统、医学及各类工业在内的多个领域有众多应用。然而,尽管图像描述研究已颇为可观,多数研究聚焦于高质量图像或受控环境,而未探索真实世界图像描述的挑战。真实世界图像描述涉及复杂动态的环境与众多关注点,其图像质量往往很差,即便对人类而言也是一项艰巨任务。本文使用新建的真实世界数据集(包含来自 MIT Indoor scenes 数据集的 65 个不同场景类别、800+ 张图像)评估基于不同编码机制、语言解码器与训练流程构建的多种模型的性能。该数据集采用 IC3 方法进行描述,该方法通过总结标准图像描述模型从图像独特视角所覆盖的细节,生成更具描述性的描述。
引用
@article{arxiv.2308.02833,
title = {A Comprehensive Analysis of Real-World Image Captioning and Scene Identification},
author = {Sai Suprabhanu Nallapaneni and Subrahmanyam Konakanchi},
journal= {arXiv preprint arXiv:2308.02833},
year = {2023}
}
备注
17 pages, 12 figures, 2 tables