中文

现代视觉模型能否区分物体与仿冒品?

计算机视觉与模式识别 2025-11-26 v2

摘要

计算机视觉的最新进展使模型在识别基准测试方面表现出强性能,但与人类感知相比仍存在显著差距。一个细微的能力是判断一幅图像是否看起来像某件物体,却并非该物体的实例。我们研究了视觉语言模型如 CLIP 是否捕获了这一区别。我们策划了一个名为 RoLA (Real or Lookalike) 的数据集,包含真实样本和仿冒样本(如玩具、雕塑、绘画、 pareidolia),覆盖多个类别。我们首先评估了基于提示的基线模型,使用配对的 "真实/仿冒" 提示。随后我们估计了 CLIP 嵌入空间中的一个方向,将表示在真实与仿冒之间移动。将该方向应用于图像和文本嵌入,可提高 Conceptual12M 上跨模态检索中的辨识度,也增强了由 CLIP 前缀captioner 生成的标题。

关键词

引用

@article{arxiv.2511.19200,
  title  = {Can Modern Vision Models Understand the Difference Between an Object and a Look-alike?},
  author = {Itay Cohen and Ethan Fetaya and Amir Rosenfeld},
  journal= {arXiv preprint arXiv:2511.19200},
  year   = {2025}
}