PatchTraj:基于动态 Patch 的统一时频表示学习用于轨迹预测
计算机视觉与模式识别
2025-08-01 v3 人工智能
摘要
行人轨迹预测是自动驾驶和机器人领域的关键任务。虽然现有的基于点的和基于网格的方法存在两个主要局限性: insufficiently modeling human motion dynamics,即未能平衡局部运动细节与长程时空依赖关系;以及时序表示缺乏与其频率分量在联合建模轨迹序列时的相互作用。为此,我们提出了 PatchTraj,一个集成时频联合建模的动态 Patch 基框架,用于轨迹预测。具体而言,我们将轨迹分解为原始时序序列和频率分量,并采用动态 Patch 分割进行多尺度分段,捕获层次化运动模式。每个 Patch 经过自适应嵌入,结合尺度感知特征提取,随后进行层次化特征聚合,以建模细粒度和长程依赖关系。两个分支的输出经跨模态注意力进一步增强,从而促进时序和频谱线索的互补融合。 resulting enhanced embeddings 具备强大的表达能力,使即使在使用基础 Transformer 架构的情况下也能实现精确预测。在 ETH-UCY、SDD、NBA 和 JRDB 数据集上进行的广泛实验表明,我们的方法达到了最先进的性能。尤其是在以自恭 JRDB 数据集为代表的 egocentric 数据集上,PatchTraj 在 ADE 上实现了 26.7% 的显著相对提升,在 FDE 上实现了 17.4% 的显著相对提升,凸显了其在具身智能领域的巨大潜力。
引用
@article{arxiv.2507.19119,
title = {PatchTraj: Unified Time-Frequency Representation Learning via Dynamic Patches for Trajectory Prediction},
author = {Yanghong Liu and Xingping Dong and Ming Li and Weixing Zhang and Yidong Lou},
journal= {arXiv preprint arXiv:2507.19119},
year = {2025}
}