面向长视频的自监督动物个体识别
计算机视觉与模式识别
2026-01-15 v1
摘要
在长时视频中识别动物个体对于行为生态学、野生动物监测和畜牧业管理至关重要。传统方法需要大量人工标注,而现有的自监督方法计算需求高,且因内存限制和时间误差传播而不适用于长序列。我们提出一种高效的自监督方法,将动物个体识别重新定义为一个全局聚类任务,而非顺序追踪问题。我们的方法假设单个视频中个体数量已知且固定——这是实践中的常见场景——并且只需要边界框检测和总数。通过对帧对进行采样,使用冻结的预训练骨干网络,并采用自举机制与匈牙利算法进行批内伪标签分配,我们的方法无需身份标签即可学习判别性特征。我们借鉴了视觉-语言模型中的二元交叉熵损失,实现了最先进的准确率(97%),同时每批消耗的 GPU 内存不到 1 GB——比标准对比方法低一个数量级。在具有挑战性的真实世界数据集(3D-POP 鸽子和 8 头小牛进食视频)上进行评估,我们的框架匹配或超越了在超过 1000 帧标注数据上训练的监督基线,有效消除了人工标注瓶颈。这项工作使得在消费级硬件上实现实用、高精度的动物个体识别成为可能,在资源受限的研究环境中具有广泛适用性。本文所有代码见 \href{https://huggingface.co/datasets/tonyFang04/8-calves}{此处}。
引用
@article{arxiv.2601.09663,
title = {Self-Supervised Animal Identification for Long Videos},
author = {Xuyang Fang and Sion Hannuna and Edwin Simpson and Neill Campbell},
journal= {arXiv preprint arXiv:2601.09663},
year = {2026}
}
备注
11 pages, 1 figure