中文

全景描述:图像与文本的等价桥梁

计算机视觉与模式识别 2025-11-26 v3

摘要

本工作引入了全景描述(panoptic captioning)这一新任务,旨在寻找图像的最小文本等价物,具有广泛的潜在应用前景。我们首次将全景描述表述为为图像生成综合性文本描述的任务,包含所有实体、各自位置与属性、实体之间的关系,以及整体图像状态。通过广泛评估,我们发现当前多模态大语言模型(MLLM)在解决全景描述方面表现有限。为此,我们提出了一个有效的数据引擎 PancapEngine 以生产高质量数据,并提出了一种新方法 PancapChain 以改进全景描述。具体而言,PancapEngine 通过精细的检测套件检测图像中多样化的实体类别,然后通过实体感知提示生成所需的全景描述。此外,PancapChain 显式地将具有挑战性的全景描述任务分解为多个阶段,逐步生成全景描述。更重要的是,我们贡献了一个全面的评估指标 PancapScore 和一个人工 Curated 测试集,以可靠地评估模型。实验表明,我们的 PancapChain-13B 模型能够超越当前开源 MLLM如 InternVL-2.5-78B,甚至超越专有模型如 GPT-4o 和 Gemini-2.0-Pro,展示了我们数据引擎和方法的有效性。项目页面: https://visual-ai.github.io/pancap/

关键词

引用

@article{arxiv.2505.16334,
  title  = {Panoptic Captioning: An Equivalence Bridge for Image and Text},
  author = {Kun-Yu Lin and Hongjun Wang and Weining Ren and Kai Han},
  journal= {arXiv preprint arXiv:2505.16334},
  year   = {2025}
}

备注

NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/