中文

ReflectCAP:基于反思记忆的详细图像描述

人工智能 2026-04-15 v1 计算机视觉与模式识别

摘要

详细图像描述需要同时满足事实 grounding 与细粒度覆盖,但现有方法尚未能同时实现这两者。我们通过反思记忆引导的图像描述(ReflectCAP)来解决这一矛盾,其中多智能体管线分析大型视觉语言模型(LVLM)在哪些方面持续产生幻觉,以及在哪些方面系统性遗漏,将这些模式提炼为可复用的指南,称为结构化反思笔记。推理阶段,这些笔记引导captioning模型在两个维度上工作——即要避免的方面和要关注的方面,从而生成详细描述,同时提升事实性和覆盖范围。将该方法应用于8个LVLM(涵盖GPT-4.1系列、Qwen系列和InternVL变体),ReflectCAP在事实性与覆盖范围之间的权衡达到帕累托前沿,在CapArena-Auto上显著提升,其中生成的描述将与强参考模型进行头对头评判。此外,ReflectCAP在caption质量与计算成本之间的权衡优于模型扩展或现有多智能体管线,后者的开销高出21%--36%,这使得在实际的成本和延迟约束下,高质量的详细描述变得可行。

关键词

引用

@article{arxiv.2604.12357,
  title  = {ReflectCAP: Detailed Image Captioning with Reflective Memory},
  author = {Kyungmin Min and Minbeom Kim and Kang-il Lee and Seunghyun Yoon and Kyomin Jung},
  journal= {arXiv preprint arXiv:2604.12357},
  year   = {2026}
}