S-VAM:通过自蒸馊几何与语义前瞻实现的shortcut视频-动作模型
计算机视觉与模式识别
2026-03-19 v2 机器人学
摘要
视频动作模型 (VAM) 因其强大的复杂操作任务视觉前瞻能力而成为机器人学习的有前景的范式。然而,当前 VAM 通常依赖缓慢的多步骤视频生成或噪声的单步骤特征提取,无法同时保证实时推理和高保真度前瞻。为此,我们提出 S-VAM,即一种shortcut视频-动作模型,通过单次前向传播预测连贯的几何与语义表示。这些被预测的表示作为稳定的蓝图,显著简化了动作预测。为实现这一高效的shortcut,我们引入一种新颖的自蒸馈策略,将多步骤去噪的结构生成先验浓缩为单步骤推理。具体而言,来自扩散模型自身多步骤生成视频提取的视觉基础模型 (VFM) 表示作为教师目标。轻量级decoupler 作为学生,学习将噪声的单步骤特征直接映射到这些目标。实验在仿真环境和真实世界中表明,我们的 S-VAM 在复杂环境下优于最先进的方法,实现了高效且精确的操作。我们的项目页面为 https://haodong-yan.github.io/S-VAM/
引用
@article{arxiv.2603.16195,
title = {S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight},
author = {Haodong Yan and Zhide Zhong and Jiaguan Zhu and Junjie He and Weilin Yuan and Wenxuan Song and Xin Gong and Yingjie Cai and Guanyi Zhao and Xu Yan and Bingbing Liu and Ying-Cong Chen and Haoang Li},
journal= {arXiv preprint arXiv:2603.16195},
year = {2026}
}