一叶障目:聚合多视角以更好地分类视频中的对象
计算机视觉与模式识别
2022-06-07 v1
摘要
近期,长尾识别与对象跟踪均各自取得重大进展。TAO基准将二者混合为长尾对象跟踪,以进一步反映真实世界的一面。迄今,现有方案采用在长尾分布中表现鲁棒的检测器得出逐帧结果,随后使用跟踪算法将时间上独立的检测结果结合以生成轨迹。然而,由于这些方法未考虑场景的时间变化,视频中不一致的分类结果导致整体性能低下。本文提出一种集合分类器,通过聚合轨迹中所含多视角信息提升轨迹分类准确率。为应对视频中稀疏标注,我们进一步提出可最大化数据效率的轨迹增广。该集合分类器可即插即用于现有对象跟踪器,并大幅提升长尾对象跟踪性能。仅需将我们的方法附加于ResNet-101之上的QDTrack,我们便在TAO验证集和测试集上分别以19.9%和15.7%的TrackAP_50取得新的最先进(SOTA)结果。
引用
@article{arxiv.2206.02116,
title = {Cannot See the Forest for the Trees: Aggregating Multiple Viewpoints to Better Classify Objects in Videos},
author = {Sukjun Hwang and Miran Heo and Seoung Wug Oh and Seon Joo Kim},
journal= {arXiv preprint arXiv:2206.02116},
year = {2022}
}
备注
Accepted to CVPR 2022