中文

生成人类场景理解的同质异构体

计算机视觉与模式识别 2026-02-25 v3 人工智能

摘要

人类视觉将来自视觉外周的低保真度“要点”信息与来自注视位置的稀疏但高保真度信息相结合,以构建对视觉场景的连贯理解。在本文中,我们介绍了 MetamerGen,这是一种用于生成与人类潜在场景表示相对齐的场景的工具。MetamerGen 是一种潜在扩散模型,它将外周获取的场景要点信息与场景观看注视获取的信息相结合,生成人类观看场景后所理解内容的图像同质异构体。从高保真度和低保真度(即“注视中心化”)输入生成图像构成了一个新颖的图像到图像合成问题,我们通过引入注视中心化场景的双流表示来解决该问题,该表示由 DINOv2 token 组成,融合了来自注视区域的细节特征与捕获场景上下文的外周退化特征。为了评估 MetamerGen 生成的图像与潜在人类场景表示的感知对齐程度,我们进行了一项异同判断行为实验,要求参与者对生成图像和原始图像给出“相同”或“不同”的判断。借此,我们识别出对于观看者形成的潜在场景表示确实是同质异构体的场景生成结果。MetamerGen 是理解场景理解的强大工具。我们的概念验证分析揭示了在多个视觉处理层级上促成人类判断的具体特征。虽然它甚至可以在随机注视条件下生成同质异构体,但我们发现,当生成的场景以观看者自身的注视区域为条件时,高级语义对齐最能预测同质异构性。

关键词

引用

@article{arxiv.2601.11675,
  title  = {Generating metamers of human scene understanding},
  author = {Ritik Raina and Abe Leite and Alexandros Graikos and Seoyoung Ahn and Dimitris Samaras and Gregory J. Zelinsky},
  journal= {arXiv preprint arXiv:2601.11675},
  year   = {2026}
}