中文

图像描述的自上而下的语义细化

计算机视觉与模式识别 2026-02-17 v2 人工智能

摘要

大型视觉语言模型(VLM)在图像描述中面临内在矛盾:其强大的单步生成能力常导致决策过程盲目,难以在捕获丰富细节的同时维持全局叙事连贯性,这在需要多步骤和复杂场景描述的任务中尤为突出。为克服这一根本挑战,我们将图像描述重新定义为目标导向的分层细化规划问题,并提出了名为Top-Down Semantic Refinement(TDSR)的新型框架,将生成过程建模为马尔可夫决策过程(MDP)。然而,规划处于VLM庞大状态空间中 presents 计算上的重大难题。我们的核心贡献在于为VLM设计了高效的蒙特卡洛树搜索(MCTS)算法。通过引入视觉引导的并行扩展和轻量级价值网络,TDSR在不牺牲规划质量的前提下,将调用高成本VLM的频率降低了一个数量级。此外,一个自适应的早停机制可动态匹配图像复杂度与计算开销。针对多个基准测试(包括DetailCaps、COMPOSITIONCAP和POPE)进行大量实验,表明TDSR作为一个即插即用模块,可显著提升现有VLM(如LLaVA-1.5、Qwen2.5-VL)的性能,在细粒度描述、组合泛化和幻觉抑制方面实现最先进或高度竞争的结果。

关键词

引用

@article{arxiv.2510.22391,
  title  = {Top-Down Semantic Refinement for Image Captioning},
  author = {Jusheng Zhang and Kaitong Cai and Jing Yang and Jian Wang and Chengpei Tang and Keze Wang},
  journal= {arXiv preprint arXiv:2510.22391},
  year   = {2026}
}