中文

利用线性 in-context 学习从动态 3D 场景中为像素生成特征

计算机视觉与模式识别 2026-04-30 v1 机器学习

摘要

视觉模型最令人期待的应用之一是像素级推理。尽管已有大量视觉基础模型,但我们仍缺乏有效地在像素水平嵌入视觉场景时空属性的表示。现有的框架要么在基于图像的预文本任务上训练,不考虑动态元素;要么在视频序列上训练,用于动作级推理,难以扩展到稠密像素级预测。我们提出了一个从视频中学习像素精确特征描述符的框架,称为 LILA。我们的训练框架的核心要素是线性 in-context 学习。LILA 利用估计的深度和运动等时空线索图(depth and motion),这些线索由即插即用的网络估计得出。尽管这些线索具有噪声性质,LILA 仍能在未经精心挑选的视频数据集上有效训练,将语义和几何属性以时序一致的方式嵌入其中。我们在多样化的视觉任务上展示了所学表示的显著经验优势:视频对象分割、表面法线估计和语义分割。

关键词

引用

@article{arxiv.2604.26488,
  title  = {Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners},
  author = {Nikita Araslanov and Martin Sundermeyer and Hidenobu Matsuki and David Joseph Tan and Federico Tombari},
  journal= {arXiv preprint arXiv:2604.26488},
  year   = {2026}
}

备注

To appear at CVPR 2026 (oral). Project website: https://lila-pixels.github.io