中文

开放词汇时空语义表示的组合语义学

计算机视觉与模式识别 2026-05-26 v2 机器学习

摘要

视觉-语言模型(VLMs)将环境感知转化为可由 LLM 解释的视觉-语言语义。然而,完成复杂任务往往需要推理超出当前所感知的信息。我们提出潜在组合语义嵌入 z* 作为一种基于学习的、可查询时空语义记忆的原则性知识表示。我们从数学上证明 z* 总是可求的,且最优 z* 是任意集合 Z 的质心。我们推导了估计相关与无关语义可分离性的概率界。我们证明 z* 可通过迭代梯度下降从视觉外观与单一描述中发现。我们在包括 CLIP 和 SBERT 在内的四个嵌入空间上实验验证了我们的发现。结果表明,z* 可表示由 SBERT 编码的多达 10 个语义,对于理想均匀分布式高维嵌入则可多达 100 个语义。我们引入三个具有重叠语义的新数据集,表明在常规非重叠标注上训练的常用 VLMs 能发现 z*。我们新颖的充分相似性推断方法克服了常规推断的根本局限,并将高层重叠语义推断性能平均提升了 19.63 mIoU。

关键词

引用

@article{arxiv.2310.04981,
  title  = {Compositional Semantics for Open Vocabulary Spatio-semantic Representations},
  author = {Robin Karlsson and Francisco Lepe-Salazar and Kazuya Takeda},
  journal= {arXiv preprint arXiv:2310.04981},
  year   = {2026}
}

备注

Preprint