AtlasVA:面向无教师VLM智能体的自演化视觉技能记忆
计算机视觉与模式识别
2026-05-19 v1
摘要
视觉语言模型(VLM)智能体日益依赖记忆增强的强化学习以跨长期任务复用经验,但大多数现有框架将记忆存储为文本,依赖专有教师模型进行总结或细化。这种设计不符合空间决策需求:几何先验被压缩到损失可接受的语言中,稀疏交互通常通过延迟的文本反馈而非密集的视觉依托信号进行监督。我们认为,VLM智能体的可复用经验应保持视觉依托。基于此洞见,我们提出AtlasVA,一种无教师的视觉技能记忆框架,将记忆组织为三个互补层次:空间热力图、视觉示例和符号文本技能。AtlasVA进一步基于轨迹统计和轻量级网格启发式自主演化危险和亲和力热力图,并将这些自演化热力图作为潜在的加权奖励用于强化学习。这在没有外部LLM监督的情况下统一了感知、记忆和优化。在Sokoban、FrozenLake、3D embodied navigation和3D机器人操纵基准测试中进行实验,结果表明AtlasVA在文本中心记忆基线和竞争性VLM智能体上 consistently 优于,尤其在空间密集型任务上取得显著提升。
引用
@article{arxiv.2605.17933,
title = {AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents},
author = {Pan Wang and Yihao Hu and Xiujin Liu and Jingchu Yang and Hang Wang and Zhihao Wen},
journal= {arXiv preprint arXiv:2605.17933},
year = {2026}
}