中文

基于自监督学习物体语义相似性

计算机视觉与模式识别 2024-05-09 v1 机器学习 神经与进化计算

摘要

人类判断两个物体的相似性不仅基于视觉外观,还基于其语义相关性。然而,目前尚不清楚人类是如何学习物体与类别之间的语义关系的。语义知识的一个重要来源是,语义相关的物体经常在同一上下文中共同出现。例如,叉子和盘子被认为是相似的,至少部分原因是它们经常在“厨房”或“进食”的上下文中被一起体验到。在此,我们研究利用此类共现统计的生物启发学习原理,是否足以从原始视觉输入或视觉与语言结合的输入中从头学习具有语义结构的物体表示。为此,我们通过将展示不同上下文中物体的真实场景短视频片段绑定在一起,来模拟视觉体验的时间序列。一个生物启发的神经网络模型对时间相近的视觉表示进行对齐,同时对视觉表示与类别标签表示进行对齐,以模拟视觉-语言对齐。我们的结果表明,我们的模型会根据上下文(如厨房或卧室)对物体表示进行聚类,特别是在网络的高层中,这与人类类似。相比之下,较低层往往更好地反映物体的身份或类别。为了实现这一点,模型利用了两种不同的策略:视觉-语言对齐确保同一类别的不同物体具有相似的表示,而时间对齐则利用同一上下文中的物体经常被连续观察到这一特性,使它们的表示更加相似。总体而言,我们的工作提出时间对齐和视觉-语言对齐是解释人类某些形式语义知识起源的合理计算原理。

关键词

引用

@article{arxiv.2405.05143,
  title  = {Learning Object Semantic Similarity with Self-Supervision},
  author = {Arthur Aubret and Timothy Schaumlöffel and Gemma Roig and Jochen Triesch},
  journal= {arXiv preprint arXiv:2405.05143},
  year   = {2024}
}