基于测试时训练的流式视觉空间智能:Spatial-TTT
计算机视觉与模式识别
2026-03-13 v1 机器学习
摘要
人类通过视觉观察序列来感知和理解现实世界,因此能够持续维护和更新来自potentially无限视频流的空间证据的能力,对空间智能至关重要。核心挑战不仅是更长的上下文窗口,而是如何在时间中选择、组织和保留空间信息。在本文中,我们提出了Spatial-TTT以实现基于测试时训练的流式视觉空间智能,这种方法通过调整子集参数(快速权重)来捕获和组织长时段场景视频中的空间证据。具体而言,我们设计了混合架构,采用大块更新并行于滑动窗口注意力,以实现高效的空间视频处理。为进一步促进空间感知,我们在TTT层上引入空间预测机制,应用3D时空卷积,鼓励模型在帧之间捕获几何对应关系和时间连续性。除了架构设计,我们构建了一个包含稠密3D空间描述的数据集,指导模型以结构化方式更新其快速权重以记忆和组织全局3D空间信号。广泛的实验表明,Spatial-TTT改进了长时段空间理解,在视频空间基准测试中实现了最先进的性能。项目页面:https://liuff19.github.io/Spatial-TTT。
引用
@article{arxiv.2603.12255,
title = {Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training},
author = {Fangfu Liu and Diankun Wu and Jiawei Chi and Yimo Cai and Yi-Hsin Hung and Xumin Yu and Hao Li and Han Hu and Yongming Rao and Yueqi Duan},
journal= {arXiv preprint arXiv:2603.12255},
year = {2026}
}
备注
Project Page: https://liuff19.github.io/Spatial-TTT