TraceVision:基于轨迹的视觉语言模型用于人类式空间理解
计算机视觉与模式识别
2026-02-25 v2
摘要
近期大型视觉语言模型(LVLMs)在图像理解和自然语言生成方面展现出惊人的能力。然而,现有方法主要关注全局图像理解,难以模拟人类视觉注意力轨迹,以及解释描述与特定区域之间的关联。我们提出 TraceVision,一个集成轨迹感知空间理解的统一视觉语言模型。TraceVision 采用轨迹感知视觉感知(TVP)模块,用于视觉特征与轨迹信息的双向融合。我们设计几何简化以从原始轨迹中提取语义关键点,并提出三阶段训练流程,使轨迹引导描述生成和区域定位。我们将 TraceVision 扩展到轨迹引导的分割和视频场景理解,实现跨帧跟踪和时序注意力分析。我们构建了基于推理的交互式局部叙事数据集(RILN),以增强逻辑推理和可解释性。广泛实验在轨迹引导的描述生成、文本引导的轨迹预测、理解和分割方面表明,TraceVision 实现了最先进的性能,为直观的空间交互和可解释视觉理解奠定了基础。
引用
@article{arxiv.2602.19768,
title = {TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding},
author = {Fan Yang and Shurong Zheng and Hongyin Zhao and Yufei Zhan and Xin Li and Yousong Zhu and Chaoyang Zhao Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2602.19768},
year = {2026}
}