通过知识蒸馏在多目标跟踪中利用基础模型:将 DINOv2 特征蒸馏到 FairMOT
计算机视觉与模式识别
2024-08-06 v2
摘要
多目标跟踪 (MOT) 是计算机视觉任务,已在 various 行业中应用。一些常见的 MOT 局限包括目标外观变化、遮挡或拥挤场景。为解决这些挑战,机器学习方法被广泛部署,利用大型数据集、复杂模型和大量计算资源。由于实际限制,无法获得上述资源。然而,随着人工智能公司最近发布的基础模型,预训练模型在大规模数据集和资源上使用最先进的方法进行训练。本工作尝试通过知识蒸馏利用一种称为 DINOv2 的基础模型。 proposed 方法使用教师-学生体系结构,其中 DINOv2 为教师,FairMOT backbone HRNetv2 W18 为学生。结果表明,虽然 proposed 方法在某些情景下显示出改进,但并不始终优于原始 FairMOT 模型。这些发现突显了将基础模型应用于知识蒸馏的潜力与局限性。
引用
@article{arxiv.2407.18288,
title = {Leveraging Foundation Models via Knowledge Distillation in Multi-Object Tracking: Distilling DINOv2 Features to FairMOT},
author = {Niels G. Faber and Seyed Sahand Mohammadi Ziabari and Fatemeh Karimi Nejadasl},
journal= {arXiv preprint arXiv:2407.18288},
year = {2024}
}
备注
This is an MSc thesis by Niels Faber, supervised by the two other authors