中文

探究 CLIP 对 360 度文本与视觉语义的理解能力

计算机视觉与模式识别 2026-04-28 v1

摘要

从文本即时生成丰富的 360 度全景世界的梦想正迅速成为现实,然而我们在可靠评估其语义对齐的能力上仍存在关键空白。对比语言-图像预训练 (CLIP) 模型作为标准的 AI 评估器,主要在透视图文对上训练,其对 360 度全景图文对独特特征的理解仍是一个开放问题。本文通过首先引入两个概念来填补这一空白:\emph{360 度文本语义}(由显式格式标识符传达的语义信息)和 \emph{360 度视觉语义}(在水平循环移位下不变的语义)。为了探究 CLIP 对这些语义的理解,我们随后提出了使用关键词操作和不同幅度的水平循环移位的新颖评估方法。对流行 CLIP 配置的严格统计分析表明:(1) CLIP 模型有效利用了显式文本标识符,展示了对 360 度文本语义的理解;以及 (2) CLIP 模型未能在水平循环移位下稳健地保持语义对齐,表明其对 360 度视觉语义的理解有限。为了解决这一局限性,我们提出了一个基于 LoRA 的微调框架,该框架显式地注入对循环移位的不变性。我们微调后的模型表现出对 360 度视觉语义更好的理解能力,尽管在原始语义评估性能上略有下降,这突显了将 CLIP 适应于 360 度全景图像时的一个基本权衡。代码可在 https://github.com/littlewhitesea/360Semantics 获取。

关键词

引用

@article{arxiv.2604.24642,
  title  = {Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics},
  author = {Hai Wang and Xiaochen Yang and Mingzhi Dong and Jing-Hao Xue},
  journal= {arXiv preprint arXiv:2604.24642},
  year   = {2026}
}

备注

Project Page: https://littlewhitesea.github.io/360Semantics.github.io/