中文

一补丁胜于万象:统一零样本图像描述框架

计算机视觉与模式识别 2026-05-05 v5

摘要

零样本描述器是最近提出的模型,利用通用视觉语言表示对图像进行描述,而无需依赖配对图像-文本数据。为了描述图像,这类模型通过文本解码文本对齐的图像特征,但仅限于全局表示和整体图像描述。我们提出了统一的零样本描述框架,将方法从图像中心转向补丁中心,使其能够在无需区域级监督的情况下对任意区域进行描述。不依赖于全局图像表示,我们将单个补丁视为原子级描述单元,并聚合以描述任意区域,从单个补丁到非连续区域再到整个图像。我们分析了使当前潜在描述器在我们新提出的框架中工作的关键要素。实验表明,产生有意义稠密视觉特征的骨干网络(如 DINO)是实现在多个基于区域的描述任务中取得 state-of-the-art 性能的关键。与其他基线和最新竞争模型相比,我们的模型在零样本稠密描述和区域集合描述上取得更好性能。我们还引入了新的轨迹描述任务,进一步证明了基于补丁的语义表示在灵活的描述生成方面的有效性。项目页面位于 https://paciosoft.com/Patch-ioner/。

关键词

引用

@article{arxiv.2510.02898,
  title  = {One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework},
  author = {Lorenzo Bianchi and Giacomo Pacini and Fabio Carrara and Nicola Messina and Giuseppe Amato and Fabrizio Falchi},
  journal= {arXiv preprint arXiv:2510.02898},
  year   = {2026}
}

备注

IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: https://paciosoft.com/Patch-ioner/