中文

Trace Anything:通过轨迹场将任意视频表示为 4D

计算机视觉与模式识别 2025-10-16 v1

摘要

有效的时空表征是建模、理解和预测视频动态的基础。像素作为视频的原子单元,会在时间内追踪连续的 3D 轨迹,作为动态的基本元素。基于这一原理,我们提出将任意视频表示为轨迹场(Trajectory Field):一种为视频中每个帧的每个像素分配连续 3D 轨迹函数的稠密映射。通过该表征,我们引入 Trace Anything,一个在单次前向传递中预测整个轨迹场的神经网络。具体而言,对于每个帧的每个像素,我们的模型预测一组控制点,用于参数化轨迹(即 B 样条),从而在任意查询时间点获取其 3D 位置。我们在大规模 4D 数据上训练了 Trace Anything 模型,包括来自我们新平台的数据,实验表明:(i) Trace Anything 在我们新的轨迹场估计基准上取得 SOTA 性能,在已建立的点轨迹基准上表现竞争;(ii) 由于其一次通过的范式,显著提升效率,不需要迭代优化或额外估计器;(iii) 它展现出涌现能力,包括目标导向操控、运动预测和时空融合。项目页面:https://trace-anything.github.io/。

关键词

引用

@article{arxiv.2510.13802,
  title  = {Trace Anything: Representing Any Video in 4D via Trajectory Fields},
  author = {Xinhang Liu and Yuxi Xiao and Donny Y. Chen and Jiashi Feng and Yu-Wing Tai and Chi-Keung Tang and Bingyi Kang},
  journal= {arXiv preprint arXiv:2510.13802},
  year   = {2025}
}