中文

学会看见房间中的大象:人类与 AI 中的自监督上下文推理

计算机视觉与模式识别 2026-02-24 v3 人工智能

摘要

人类很少在孤立状态下感知物体,而是通过共现元素之间的关系来解读场景。此类上下文知识如何在无显式监督下习得仍不清楚。在此,我们结合人类心理物理实验与计算建模来研究上下文推理的出现。被试暴露于嵌入自然场景中的新颖物体,这些场景遵循捕捉全局上下文、局部上下文与拥挤效应的预定义上下文规则。在观看简短训练视频后,被试完成“掀盖”任务,其中须在尺寸、分辨率与空间排布变化下由周围上下文推断隐藏物体。人类在无标签或反馈情况下快速习得这些上下文关联,并对上下文变化表现出稳健泛化。随后我们引入 SeCo(用于上下文推理的自监督学习,Self-supervised learning for Context Reasoning),一个受生物学启发的从复杂场景学习上下文关系的模型。SeCo 用独立视觉编码器编码目标与上下文,并将潜在上下文先验存储于可学习的外部记忆模块中。给定上下文线索,模型检索可能的物体表征以推断隐藏目标。SeCo 优于最先进的自监督学习方法,并预测出与人类行为最一致的物体放置,凸显了上下文关联在场景理解中的核心作用。

关键词

引用

@article{arxiv.2211.12817,
  title  = {Learning to See the Elephant in the Room: Self-Supervised Context Reasoning in Humans and AI},
  author = {Xiao Liu and Soumick Sarker and Ankur Sikarwar and Bryan Atista Kiely and Gabriel Kreiman and Zenglin Shi and Mengmi Zhang},
  journal= {arXiv preprint arXiv:2211.12817},
  year   = {2026}
}