中文

为高分辨率图像生成准确且详尽的描述

计算机视觉与模式识别 2025-11-03 v1 人工智能

摘要

视觉语言模型 (VLM) 常常难以为高分辨率图像生成准确且详尽的描述,因为它们通常在低分辨率输入 (例如 224x224 或 336x336 像素) 上进行预训练。将高分辨率图像压缩至这些尺寸可能导致视觉细节丢失和重要物体遗漏。为此,我们提出一种新型管线,将视觉语言模型、大语言模型 (LLM) 和目标检测系统集成,以提升描述质量。我们提出的管线通过新型的多阶段过程来细化描述。给定高分辨率图像,首先使用 VLM 生成初始描述,然后通过 LLM 识别图像中的关键物体。LLM 预测与已识别关键物体可能共现的额外物体,并由目标检测系统进行验证。未被初始描述提及的新检测物体将进行面向特定区域的描述,以确保其被包含在内。这一过程在保留细节的同时减少幻觉,通过消除对未检测物体的引用实现。我们使用来自大型多模态模型的成对比较和量化评分,以及用于幻觉检测的基准,对增强后的描述进行评估。实验在筛选好的高分辨率图像数据集上进行,表明我们的管线生成更详尽且可靠的图像描述,同时有效最小化幻觉。

关键词

引用

@article{arxiv.2510.27164,
  title  = {Generating Accurate and Detailed Captions for High-Resolution Images},
  author = {Hankyeol Lee and Gawon Seo and Kyounggyu Lee and Dogun Kim and Kyungwoo Song and Jiyoung Jung},
  journal= {arXiv preprint arXiv:2510.27164},
  year   = {2025}
}

备注

Work conducted in 2024; released for archival purposes