LatentAM:通过在线字典学习实现实时大规模潜在高斯注意力映射
机器人学
2026-02-16 v1 计算机视觉与模式识别
摘要
我们提出了LatentAM,一个在线3D高斯泼溅(3DGS)映射框架,它从流式RGB-D观测中构建可扩展的潜在特征图,用于开放词汇的机器人感知。LatentAM没有使用模型特定的解码器蒸馏高维视觉语言模型(VLM)嵌入,而是提出了一种在线字典学习方法,该方法既与模型无关又无需预训练,从而在测试时能够与不同的VLM即插即用集成。具体来说,我们的方法将每个高斯基元与一个紧凑的查询向量相关联,该向量可以使用带有可学习字典的注意力机制转换为近似的VLM嵌入。该字典从流式观测中高效初始化,并在信任域正则化下在线优化,以适应不断变化的场景语义。为了扩展到长轨迹和大环境,我们进一步提出了一种基于体素哈希的高效地图管理策略,其中优化限制在GPU上的活动局部地图,而全局地图则存储在CPU上并建立索引,以保持GPU内存使用有界。在公共基准和一个大规模自定义数据集上的实验表明,与最先进的方法相比,LatentAM实现了显著更好的特征重建保真度,同时在评估数据集上实现了接近实时的速度(12-35 FPS)。我们的项目页面位于:https://junwoonlee.github.io/projects/LatentAM
引用
@article{arxiv.2602.12314,
title = {LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning},
author = {Junwoon Lee and Yulun Tian},
journal= {arXiv preprint arXiv:2602.12314},
year = {2026}
}
备注
8 pages, 5 figures