中文

TrajLoom:从视频生成密集的未来轨迹

计算机视觉与模式识别 2026-03-25 v1

摘要

预测未来运动是视频理解和可控视频生成中的关键任务。密集点轨迹作为一种紧凑而富有表现力的运动表示方法,然而从观测视频中建模其未来演化仍然具有挑战性。我们提出了一个框架,从过去的轨迹和视频上下文中预测未来的轨迹和可见性。该方法包含三个组成部分:(1)网格锚点偏移编码(Grid-Anchor Offset Encoding),通过将每个点表示为其像素中心锚点上的偏移来减少位置相关偏差;(2)TrajLoom-VAE,通过掩码重建和时空一致性正则化学习密集轨迹的紧凑时空潜在空间;(3)TrajLoom-Flow,通过流匹配在潜在空间中生成未来轨迹,并结合边界线索和基于策略的K步微调以实现稳定采样。我们还引入了TrajLoomBench,一个涵盖真实和合成视频的统一基准,采用与视频生成基准一致的标准化设置。与最先进的方法相比,我们的方法将预测时长从24帧扩展到81帧,同时在多个数据集上提高了运动的真实性和稳定性。预测的轨迹直接支持下游视频生成和编辑。代码、模型检查点和数据集均可在 https://trajloom.github.io/ 获取。

关键词

引用

@article{arxiv.2603.22606,
  title  = {TrajLoom: Dense Future Trajectory Generation from Video},
  author = {Zewei Zhang and Jia Jun Cheng Xian and Kaiwen Liu and Ming Liang and Hang Chu and Jun Chen and Renjie Liao},
  journal= {arXiv preprint arXiv:2603.22606},
  year   = {2026}
}

备注

Project page, code, model checkpoints, and datasets: https://trajloom.github.io/