中文

一叶障目:聚合多视角以更好地分类视频中的对象

计算机视觉与模式识别 2022-06-07 v1

摘要

近期,长尾识别与对象跟踪均各自取得重大进展。TAO基准将二者混合为长尾对象跟踪,以进一步反映真实世界的一面。迄今,现有方案采用在长尾分布中表现鲁棒的检测器得出逐帧结果,随后使用跟踪算法将时间上独立的检测结果结合以生成轨迹。然而,由于这些方法未考虑场景的时间变化,视频中不一致的分类结果导致整体性能低下。本文提出一种集合分类器,通过聚合轨迹中所含多视角信息提升轨迹分类准确率。为应对视频中稀疏标注,我们进一步提出可最大化数据效率的轨迹增广。该集合分类器可即插即用于现有对象跟踪器,并大幅提升长尾对象跟踪性能。仅需将我们的方法附加于ResNet-101之上的QDTrack,我们便在TAO验证集和测试集上分别以19.9%和15.7%的TrackAP_50取得新的最先进(SOTA)结果。

关键词

引用

@article{arxiv.2206.02116,
  title  = {Cannot See the Forest for the Trees: Aggregating Multiple Viewpoints to Better Classify Objects in Videos},
  author = {Sukjun Hwang and Miran Heo and Seoung Wug Oh and Seon Joo Kim},
  journal= {arXiv preprint arXiv:2206.02116},
  year   = {2022}
}

备注

Accepted to CVPR 2022