Patch Matters:基于局部感知的训练-free 细粒度图像描述增强
计算机视觉与模式识别
2025-04-10 v1
摘要
高质量的图像描述在提升跨模态应用性能方面发挥着关键作用,如文本到图像生成、文本到视频生成以及文本-图像检索。为生成长篇高质量描述,近期研究大量采用多模态大语言模型(MLLM)。然而,当前 MLLM 常产生细节不足或存在幻觉的描述,这一问题在开源模型与闭源模型中均存在。灵感来源于特征-整合理论,即注意力必须聚焦于特定区域才能有效整合视觉信息。我们提出了一种“划分-聚合”策略。该方法首先将图像划分为语义与空间的 patch,以提取细粒度细节,从而增强模型对图像局部感知的能力。随后,这些局部细节被层次化地聚合,以生成综合性的全局描述。为解决生成描述中的幻觉与不一致问题,我们在层次化聚合过程中引入语义级过滤机制。该训练-free 流水线可同时应用于开源模型(LLaVA-1.5、LLaVA-1.6、Mini-Gemini)和闭源模型(Claude-3.5-Sonnet、GPT-4o、GLM-4V-Plus)。大量实验表明,我们的方法生成的描述更为细致可靠,推动了无需模型再训练的跨模态描述生成。代码已公开于 https://github.com/GeWu-Lab/Patch-Matters。
引用
@article{arxiv.2504.06666,
title = {Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception},
author = {Ruotian Peng and Haiying He and Yake Wei and Yandong Wen and Di Hu},
journal= {arXiv preprint arXiv:2504.06666},
year = {2025}
}