从自动标注中学习多目标跟踪与分割
计算机视觉与模式识别
2020-03-31 v3
摘要
在本工作中,我们提出了一种自动生成训练数据并超越最先进多目标跟踪与分割(MOTS)方法的新型流程。我们提出的轨迹挖掘算法将原始街景视频转化为高保真 MOTS 训练数据,具有可扩展性,并克服了对昂贵且耗时的手动标注方法的需求。我们利用了最先进的实例分割结果,结合同样在自动采集训练数据上训练的光流预测。我们的第二大贡献是 MOTSNet——一种用于 MOTS 的深度学习、检测即跟踪架构——部署了一种新颖的掩码池化层以改进随时间的目标关联。使用我们自动提取的数据训练 MOTSNet,在全新的 KITTI MOTS 数据集上显著提升了 sMOTSA 分数(车辆/行人分别 +1.9%/+7.5%),且 MOTSNet 在 MOTSChallenge 数据集上比先前最佳方法提升 +4.1%。我们最令人印象深刻的发现是,即使在完全缺乏手动标注 MOTS 训练数据的情况下,我们也能超越先前性能最佳的工作。
引用
@article{arxiv.1912.02096,
title = {Learning Multi-Object Tracking and Segmentation from Automatic Annotations},
author = {Lorenzo Porzi and Markus Hofinger and Idoia Ruiz and Joan Serrat and Samuel Rota Bulò and Peter Kontschieder},
journal= {arXiv preprint arXiv:1912.02096},
year = {2020}
}