中文

GUIDE-CoT:使用思维链进行目标驱动与用户知情的行人轨迹动态估计

计算机视觉与模式识别 2025-03-11 v1

摘要

尽管大型语言模型(LLM)近期在推理任务中展现出优异的结果,但由于两个关键局限性——视觉信息利用不足以及预测完整轨迹的困难——将其应用于行人轨迹预测仍具挑战。为应对这些挑战,我们提出了使用思维链进行目标驱动与用户知情的行人轨迹动态估计(Goal-driven and User-Informed Dynamic Estimation for pedestrian trajectory using Chain-of-Thought, GUIDE-CoT)。该方法集成了两个创新模块:(1)面向目标的视觉提示,结合视觉提示与预训练视觉编码器以提高目标预测精度;(2)用于轨迹生成的思维链(CoT)LLM,生成朝向预测目标的逼真轨迹。此外,该方法引入了可控轨迹生成,允许对预测路径进行灵活且用户引导的修改。通过在 ETH/UCY 基准数据集上的大量实验,该方法达到了 SOTA 性能,在行人轨迹预测中兼具高精度与更强的适应性。代码公开于 https://github.com/ai-kmu/GUIDE-CoT。

关键词

引用

@article{arxiv.2503.06832,
  title  = {GUIDE-CoT: Goal-driven and User-Informed Dynamic Estimation for Pedestrian Trajectory using Chain-of-Thought},
  author = {Sungsik Kim and Janghyun Baek and Jinkyu Kim and Jaekoo Lee},
  journal= {arXiv preprint arXiv:2503.06832},
  year   = {2025}
}

备注

10 pages, 5 figures, will be published on The 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025)