通过筛选与精炼实现视觉跟踪的视频标注
计算机视觉与模式识别
2021-08-10 v1
摘要
基于深度学习的视觉跟踪器需要在带有精确边界框标注的大规模视频数据集上进行离线预训练,而此类标注获取成本高昂。我们提出一个新框架以简化视频序列的边界框标注,其采用筛选-精炼策略自动改善跟踪算法生成的初步标注。提出一种时间评估网络(T-Assess Net),能够通过测量目标定位质量来捕捉目标位置的时间一致性并筛选可靠跟踪结果。同时,设计一种视觉-几何精炼网络(VG-Refine Net),通过考虑目标外观与时间几何约束进一步增强所选跟踪结果,从而纠正不准确的跟踪结果。上述两个网络的结合提供了一种原则性方法来确保自动视频标注的质量。在大规模跟踪基准上的实验表明,我们的方法能提供高精度的边界框标注,并将人力减少94.0%,为利用扩充训练数据进一步提升跟踪性能提供了有效手段。
引用
@article{arxiv.2108.03821,
title = {Video Annotation for Visual Tracking via Selection and Refinement},
author = {Kenan Dai and Jie Zhao and Lijun Wang and Dong Wang and Jianhua Li and Huchuan Lu and Xuesheng Qian and Xiaoyun Yang},
journal= {arXiv preprint arXiv:2108.03821},
year = {2021}
}
备注
Accepted by ICCV2021