AnimalFormer:基于行为的精密畜牧业多模态视觉框架
计算机视觉与模式识别
2024-06-17 v1
摘要
我们介绍了一个用于精密畜牧业的多模态视觉框架,利用 GroundingDINO、HQSAM 和 ViTPose 模型的强大功能。这一集成套件无需对动物进行侵入性标记即可从视频数据中进行全面的行为分析。GroundingDINO 生成围绕畜禽的准确边界框,而 HQSAM 在这些边界框内分割出个体动物。ViTPose 对身体关键部位进行估计,从而促进姿态和运动分析。我们在包含 grazing、running、sitting、standing 和 walking 活动的羊数据集上进行了演示,展示了该框架提取的宝贵见解:活动和放牧模式、相互作用动态以及详细的姿态评估。该框架适用于各种物种和视频分辨率,彻底变革了非侵入性畜牧业监控,用于活动检测、计数、健康评估和姿态分析。它使数据驱动的农场管理成为可能,通过 AI 驱动的行为理解优化动物福利和生产力。
引用
@article{arxiv.2406.09711,
title = {AnimalFormer: Multimodal Vision Framework for Behavior-based Precision Livestock Farming},
author = {Ahmed Qazi and Taha Razzaq and Asim Iqbal},
journal= {arXiv preprint arXiv:2406.09711},
year = {2024}
}
备注
In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2024