AutoTraces:基于多模态大语言模型的自回归轨迹预测
计算机视觉与模式识别
2026-03-10 v1
摘要
我们提出 AutoTraces,一个用于人群密集环境中机器人轨迹预测的自回归视觉-语言-轨迹模型,借助大语言模型 (LLM) 的内在推理能力来建模复杂的人类行为。与依赖单纯文本表示的先前工作不同,我们的核心创新在于一种新颖的轨迹分词方案:将路标点表示为类别和位置标记的离散点标记,同时将路标点的数值编码为相应的点嵌入,并通过轻量级编码-解码架构无缝集成到 LLM 的空间中。该设计保留了 LLM 原生自回归生成机制,同时将其扩展至物理坐标空间,促进了轨迹数据中长期相互作用的建模。我们进一步引入自动链式思维 (CoT) 生成机制,利用多模态 LLM 从视觉观测和轨迹数据中推断时空关系,消除对手动标注的依赖。通过两阶段训练策略,AutoTraces 实现了 SOTA 预测精度,尤其在长期预测中表现突出,同时展现出强大的跨场景泛化能力并支持可变长度预测。
引用
@article{arxiv.2603.07989,
title = {AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models},
author = {Teng Wang and Yanting Lu and Ruize Wang},
journal= {arXiv preprint arXiv:2603.07989},
year = {2026}
}