基于相机陷阱录像的自监督学习构成强大的通用面部嵌入器
计算机视觉与模式识别
2025-07-15 v1 人工智能
机器学习
摘要
相机陷阱正在通过捕获大量视觉数据来革新野生动物监测;然而,单个动物的手动识别仍然是一个重大的瓶颈。本研究引入一种完全自监督的方法,以从未标记的相机陷阱录像中学习鲁莽猴面部嵌入。我们利用 DINOv2 框架,在自动挖掘的人脸裁剪上训练 Vision Transformer,无需身份标签。该方法在挑战性基准测试(如 Bossou)上显示出强大的开放集重识别性能,甚至在训练时未使用任何标记数据。本工作凸显了自监督学习在生物多样性监测中的潜力,并为可扩展的非侵入性种群研究之路打开了大门。
引用
@article{arxiv.2507.10552,
title = {Self-supervised Learning on Camera Trap Footage Yields a Strong Universal Face Embedder},
author = {Vladimir Iashin and Horace Lee and Dan Schofield and Andrew Zisserman},
journal= {arXiv preprint arXiv:2507.10552},
year = {2025}
}
备注
Accepted for publication. Project page, code and weights: https://www.robots.ox.ac.uk/~vgg/research/ChimpUFE/