中文

利用大型视觉语言模型的无训练条件图像嵌入框架

计算机视觉与模式识别 2025-12-29 v1

摘要

条件图像嵌入是关注由给定文本条件(例如颜色、流派)指示的图像特定方面的特征表示,这一直是一个具有挑战性的问题。尽管最近的视觉基础模型(如 CLIP)提供了丰富的图像表示,但它们并非设计为关注指定条件。在本文中,我们提出了 DIOR,一种利用大型视觉语言模型 (LVLM) 生成条件图像嵌入的方法。DIOR 是一种无训练方法,它提示 LVLM 用与给定条件相关的单个词描述图像。然后提取 LVLM 最后一个 token 的隐藏状态向量作为条件图像嵌入。DIOR 提供了一种通用的解决方案,无需额外训练或特定任务的先验即可应用于任何图像和条件。在条件图像相似性任务上的综合实验结果表明,DIOR 优于包括 CLIP 在内的现有无训练基线。此外,与需要额外训练的方法相比,DIOR 在多种设置下均取得了卓越的性能。

关键词

引用

@article{arxiv.2512.21860,
  title  = {Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models},
  author = {Masayuki Kawarada and Kosuke Yamada and Antonio Tejero-de-Pablos and Naoto Inoue},
  journal= {arXiv preprint arXiv:2512.21860},
  year   = {2025}
}