精炼预训练运动模型
计算机视觉与模式识别
2024-02-20 v2 人工智能
摘要
鉴于手动标注视频中运动的困难,当前最佳运动估计方法使用合成数据训练,因此由于训练/测试差距而有些困难。自监督方法有望直接在真实视频上训练,但通常表现较差。这些方法包括使用扭曲误差(即颜色恒常性)结合平滑项的方法,以及鼓励估计中循环一致性的方法(即向后跟踪应产生与向前跟踪相反的轨迹)。在这项工作中,我们承担了通过自监督训练改进最先进监督模型的挑战。我们发现,当初始化为监督权重时,大多数现有的自监督技术实际上使性能变差而不是更好,这表明看到新数据的好处被训练信号中的噪声所掩盖。专注于从真实世界未标记视频中获得“干净”的训练信号,我们提出将标签制作和训练分为两个不同阶段。在第一阶段,我们使用预训练模型估计视频中的运动,然后选择可以通过循环一致性验证的运动估计子集。这产生了视频的稀疏但准确的伪标签。在第二阶段,我们微调模型以重现这些输出,同时对输入应用增强。我们通过简单技术补充这种自举方法,这些技术使伪标签密集化和重新平衡,确保我们不仅仅在“简单”轨迹上训练。我们表明,我们的方法在真实视频中,对于短期(基于光流)和长期(多帧)像素跟踪,都能在完全监督方法上产生可靠的增益。
引用
@article{arxiv.2401.00850,
title = {Refining Pre-Trained Motion Models},
author = {Xinglong Sun and Adam W. Harley and Leonidas J. Guibas},
journal= {arXiv preprint arXiv:2401.00850},
year = {2024}
}
备注
Accepted at ICRA 2024