Tracktention:利用点跟踪加速视频注意力
计算机视觉与模式识别
2025-03-26 v1 机器学习
摘要
在视频预测中,时间一致性至关重要,以确保输出连贯且无瑕疵。传统方法(如时间注意力和3D卷积)在面对显著物体运动时可能吃力,且可能捕捉不到动态场景中的长程时间依赖性。为此,我们提出 Tracktention Layer(跟踪注意力层),一种新型架构组件,通过显式集成点跟踪信息(即跨帧对应点的序列)来增强时间对齐并有效处理复杂物体运动,保持时间内一致的特征表示。我们的做法计算高效,可无缝集成到现有模型(如视觉Transformer)中,只需最小程度的修改即可。它可以将仅用于图像的模型升级为针对视频预测的最先进模型,有时甚至能超过专为视频预测设计的模型。我们在视频深度预测和视频上色任务上进行了验证,结果表明,集成 Tracktention Layer 的模型在时间一致性方面显著优于基线方法。
引用
@article{arxiv.2503.19904,
title = {Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better},
author = {Zihang Lai and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2503.19904},
year = {2025}
}
备注
CVPR 2025. Project website: zlai0.github.io/TrackTention