揭示自监督在多视角多人关联与跟踪中的能力
计算机视觉与模式识别
2024-02-01 v1 人工智能
摘要
多视角多人关联与跟踪(MvMHAT)是多人场景视频监控中一个新颖且重要的问题,旨在在每个视角中随时间跟踪一群人,同时在同一时刻跨不同视角识别同一人,这有别于以往仅考虑随时间进行人体跟踪的 MOT 和多相机 MOT 任务。因此,MvMHAT 所需的视频需要更复杂的标注,同时包含更多用于自学习的信息。在本工作中,我们利用一个具备自监督学习意识的端到端网络来解决这一问题。具体而言,我们提出通过考虑自反性、对称性和传递性三种属性,来利用时空自一致性原理。除了自然成立的自反性属性外,我们还基于对称性和传递性属性设计了用于外观特征学习和分配矩阵优化的自监督学习损失,以实现随时间与跨视角的多人关联。此外,为了推动 MvMHAT 的研究,我们构建了两个新的大规模基准,用于不同算法的网络训练和测试。在所提出基准上的大量实验验证了我们方法的有效性。我们已向公众发布了基准和代码。
引用
@article{arxiv.2401.17617,
title = {Unveiling the Power of Self-supervision for Multi-view Multi-human Association and Tracking},
author = {Wei Feng and Feifan Wang and Ruize Han and Zekun Qian and Song Wang},
journal= {arXiv preprint arXiv:2401.17617},
year = {2024}
}