MosaicThinker:基于迭代空间表示构建的嵌入式 AI 设备端视觉空间推理
计算机视觉与模式识别
2026-02-10 v1 人工智能
摘要
当嵌入式 AI 从传统的目标检测与识别扩展到机器人操控与运动规划等更高级任务时,来自视频输入的视觉空间推理以感知物体的空间关系并指导设备动作变得必要。然而,现有的视觉语言模型(VLM)在空间推理方面能力极弱,尤其是在涉及跨多个视频帧复杂空间关系的推理任务中,因缺乏关于 3D 空间信息的认知。本文提出一种新的设备内推理计算技术,称为 MosaicThinker,通过迭代构建空间表示来增强设备端小型 VLM 在跨帧推理任务上的空间推理能力。我们的基本思想是将来自多个帧的碎片化空间信息整合到全局语义地图的统一空间表示中,并通过视觉提示引导 VLM 对该语义地图进行空间推理。实验结果表明,该技术在资源受限的嵌入式 AI 设备上,能大幅提升跨帧空间推理任务的准确率,涵盖多种类型和复杂度的推理任务。
引用
@article{arxiv.2602.07082,
title = {MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation},
author = {Haoming Wang and Qiyao Xue and Weichen Liu and Wei Gao},
journal= {arXiv preprint arXiv:2602.07082},
year = {2026}
}