SAM2Act:将视觉基础模型与记忆架构集成用于机器人操作
机器人学
2025-07-15 v4
摘要
在多样化、动态环境中运行的机器人操作系统必须具备三个关键能力:多任务交互、针对未见情景的泛化,以及空间记忆。尽管在机器人操作领域取得了显著进展,但现有方法在针对复杂环境变化实现泛化以及解决记忆依赖任务方面仍显不足。为弥合这一差距,我们引入SAM2Act,这是一种基于多视图机器人转换器的策略,利用来自大规模基础模型的视觉表示实现多分辨率上采样。SAM2Act在RLBench基准测试中的18个任务上实现了最高的平均成功率86.8%,并在The Colosseum基准测试上Demonstrate了稳健的泛化能力,在各种环境扰动下仅存在4.3%的性能差距。基于此基础,我们提出SAM2Act+,一种受SAM2启发的记忆架构,集成记忆库、编码器和注意力机制以增强空间记忆。为满足评估记忆依赖任务的需求,我们引入MemoryBench,这是一个新颖的基准,旨在评估机器人操作中的空间记忆和动作记忆。SAM2Act+在MemoryBench中基于记忆的任务上实现了94.3%的平均成功率,显著优于现有方法,推动了记忆-based机器人系统的边界。项目页面: sam2act.github.io。
关键词
引用
@article{arxiv.2501.18564,
title = {SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation},
author = {Haoquan Fang and Markus Grotz and Wilbert Pumacay and Yi Ru Wang and Dieter Fox and Ranjay Krishna and Jiafei Duan},
journal= {arXiv preprint arXiv:2501.18564},
year = {2025}
}
备注
Including Appendix, Project Page: https://sam2act.github.io