中文

面向视觉的 Light Cones:简单因果先验的视觉层级

机器学习 2026-03-27 v1 计算机视觉与模式识别

摘要

标准视觉模型将物体视为欧几里得空间中的独立点,无法捕捉诸如部件嵌入整体等的层级结构。我们引入 Worldline Slot Attention,模型将物体建模为时空世界线上的持久轨迹,其中每个物体在不同层级水平上拥有多个插槽,共享相同空间位置但在时间坐标上不同。该架构在缺乏几何结构时始终会失败:欧几里得 worldline 仅实现 0.078 的层级精度,低于随机抽样水平 (0.33),而 Lorentzian worldline 在三个数据集上实现 0.479-0.661 的精度,提升 6 倍,通过 20+ 独立运行复制验证。Lorentzian 几何也优于双曲嵌入,表明视觉层级结构需要编码非对称因果性(时间依赖性),而非树状结构(放射状分支)。我们的结果表明,层级物体发现需要几何结构来编码非对称因果性,这种归纳偏见不属于欧几里得空间,却是自然融入 Lorentzian 光锥的特性,仅需 11K 参数即可实现。代码地址:https://github.com/iclrsubmissiongram/loco

关键词

引用

@article{arxiv.2603.24753,
  title  = {Light Cones For Vision: Simple Causal Priors For Visual Hierarchy},
  author = {Manglam Kartik and Neel Tushar Shah},
  journal= {arXiv preprint arXiv:2603.24753},
  year   = {2026}
}

备注

ICLR GRaM Workshop 2026