表征迁移至视频标签传播:实现因素至关重要
计算机视觉与模式识别
2022-03-11 v1
摘要
本工作研究视频中稠密标签传播的特征表示,重点关注最近提出的利用自监督信号(如着色或时间循环一致性)学习视频对应关的方法。在文献中,这些方法已在一系列不一致的设置下被评估,难以辨别趋势或公平比较性能。从涵盖大多数现有变体的标签传播算法统一公式出发,我们系统研究了特征提取和标签传播中重要实现因素的影响。在此过程中,我们报告了适当调优的有监督和无监督静态图像基线的准确率,其高于先前工作中的结果。我们还证明,用基于静态图像的信号增强基于视频的对应线索可进一步提升性能。随后,我们试图在 DAVIS 基准上对近期基于视频的方法进行公平比较,显示出尽管使用了多种专门的基于视频的损失和训练细节,最佳方法性能水平收敛至接近我们强大的 ImageNet 基线。在 JHMDB 和 VIP 数据集上的额外比较证实了当前方法的相似性能。我们希望本研究有助于改进评估实践,并更好地为时间对应关系的未来研究方向提供信息。
引用
@article{arxiv.2203.05553,
title = {Transfer of Representations to Video Label Propagation: Implementation Factors Matter},
author = {Daniel McKee and Zitong Zhan and Bing Shuai and Davide Modolo and Joseph Tighe and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:2203.05553},
year = {2022}
}