AstraNav-Memory:长期记忆的上下文压缩
机器人学
2025-12-29 v1
摘要
终身具身导航要求智能体在不同任务之间累积、保留和利用空间语义经验,从而在新环境中高效探索,在熟悉环境中快速到达目标。虽然基于对象的记忆具有可解释性,但依赖于检测和重建管道,限制了其鲁棒性和可扩展性。我们提出一种基于图像的记忆框架,通过高效的视觉上下文压缩模块实现长期隐式记忆,同时与基于 Qwen2.5-VL 的导航策略 end-to-end 耦合。基于 ViT 主干架构并冻结 DINOv3 特征,配合轻量级 PixelUnshuffle+Conv 块的视觉 tokenizer 支持可配置的压缩率;例如,在代表性的 16 倍压缩设置下,每个图像仅编码约 30 个 token,将有效上下文容量从十几张图像扩展到数百张图像。在 GOAT-Bench 和 HM3D-OVON 上的实验结果表明,我们的方法实现了状态最佳的导航性能,提高了对不熟悉环境的探索效率,缩短了熟悉环境中的路径。消融研究进一步表明,适度的压缩在效率和准确性之间提供了最佳平衡。这些发现将压缩的图像中心记忆定位为终身具身智能体的实用且可扩展的接口,使其能够在长视觉历史上进行推理,并以类人水平进行导航。
关键词
引用
@article{arxiv.2512.21627,
title = {AstraNav-Memory: Contexts Compression for Long Memory},
author = {Botao Ren and Junjun Hu and Xinda Xue and Minghua Luo and Jintao Chen and Haochen Bai and Liangliang You and Mu Xu},
journal= {arXiv preprint arXiv:2512.21627},
year = {2025}
}