基于全局到局部重建的像素级场景理解:视觉状态需要什么-在哪里组合
计算机视觉与模式识别
2026-03-26 v2 人工智能
机器学习
机器人学
摘要
对于在动态环境中运行的机器人智能体,学习从流式视频观察中构建视觉状态表示对于顺序决策至关重要。最近的自监督学习方法在视觉任务上显示出强大的可迁移性,但它们不明确地解决良好视觉状态应编码什么。我们认为,有效的视觉状态必须捕获what-is-where,通过联合编码场景元素的语义身份及其空间位置,以实现可靠地检测跨观察中细微的动态。为此,我们提出了CroBo—a一种基于全局到局部重建目标的视觉状态表示学习框架。给定被压缩到紧凑瓶颈token的参考观察,CroBo学习从稀疏可见线索在局部目标作物中重建被遮蔽的图像块,作为上下文。这种学习目标鼓励瓶颈token编码场景范围内语义实体的细粒度表示,包括它们的身份、空间位置和配置。结果,所学的视觉状态揭示了场景元素如何随时间移动和相互作用,以支持顺序决策。我们在多样化的基于视觉的机器人策略学习基准上评估了CroBo,其中它实现了最先进的性能。重建分析和感知直线实验进一步表明,所学的表示保留了像素级场景构成,并编码跨观察中what-moves-where。项目页面可在:https://seokminlee-chris.github.io/CroBo-ProjectPage访问。
引用
@article{arxiv.2603.13904,
title = {Pixel-level Scene Understanding in One Token: Visual States Need What-is-Where Composition},
author = {Seokmin Lee and Yunghee Lee and Byeonghyun Pak and Byeongju Woo},
journal= {arXiv preprint arXiv:2603.13904},
year = {2026}
}
备注
Accepted to CVPR 2026 Workshop: Pixel-level Video Understanding in the Wild