Cattle-CLIP: 一种用于牛只行为识别的多模态视频框架
计算机视觉与模式识别
2026-04-08 v2
摘要
在真实农场环境中实现鲁棒的行为识别仍然具有挑战性,这源于若干数据相关的限制,包括标注良好的畜牧视频数据集稀缺,以及大规模预训练语料库与农业监控素材之间的显著领域差距。为应对这些挑战,我们提出了 Cattle-CLIP,一个领域自适应的视觉语言框架,将牛只行为识别重新表述为跨模态语义对齐而非纯粹的视觉分类。Cattle-CLIP 并未直接微调视觉骨干网络,而是引入了一个时间积分模块,将图像级对比预训练扩展到基于视频的行为理解,从而实现跨时间的一致语义对齐。为缓解预训练模型所使用的网络规模图像-文本数据与真实世界牛只监控素材之间的分布偏移,我们进一步引入了定制的增强策略和专门的行为提示。此外,我们构建了 CattleBehaviours6,一个经过精心整理且行为一致的视频数据集,包含跨越六种室内行为的 1905 个标注片段,以支持模型训练和评估。该数据集不仅作为我们提出方法的基准,还提供了标准化的行为谱定义,为未来畜牧行为分析研究提供了实用资源。Cattle-CLIP 在完全监督和少样本学习场景下进行了评估,特别关注数据稀缺的行为识别——这是畜牧监测中一个重要但尚未充分探索的目标。实验表明,Cattle-CLIP 在监督设置下六种行为的总体准确率达到 96.1%,对采食、饮水和站立反刍行为实现了近乎完美的召回率,并在少样本场景下展示了有限数据下的鲁棒泛化能力。
引用
@article{arxiv.2510.09203,
title = {Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video},
author = {Huimin Liu and Jing Gao and Daria Baran and AxelX Montout and Neill W Campbell and Andrew W Dowsey},
journal= {arXiv preprint arXiv:2510.09203},
year = {2026}
}
备注
16 pages, 10 figures, submitted to Information Processing in Agriculture