MHAFF:基于 CNN 和 Transformer 的多头注意力特征融合用于牛只识别
计算机视觉与模式识别
2025-01-10 v1
摘要
卷积神经网络 (CNN) 已引起研究者对利用鼻部图像识别牛只的关注。然而,CNN 往往难以捕获鼻部复杂图案中的长程依赖关系。变压器能够处理这些挑战。这启发我们将 CNN 和变压器的优势在鼻部基础的牛只识别中进行融合。加法和拼接是特征融合最常使用的技术。然而,加法无法保留判别性信息,而拼接会导致维度数值的增加。这两种方法都属于简单运算,无法发现融合特征之间的关系或相互作用。本研究旨在克服加法和拼接所面临的問題。这项研究首次引入一种新方法,即多头注意力特征融合 (MHAFF),用于牛只识别。MHAFF 在保留原始性的同时捕获不同类型融合特征之间的关系。实验表明,MHAFF 在两个公开的牛只数据集上的准确率均优于加法和拼接技术以及现有的牛只识别方法。MHAFF 显示出卓越的性能,并能快速收敛,在两个牛只数据集上分别实现最高准确率达 99.88% 和 99.52%。
引用
@article{arxiv.2501.05209,
title = {MHAFF: Multi-Head Attention Feature Fusion of CNN and Transformer for Cattle Identification},
author = {Rabin Dulal and Lihong Zheng and Muhammad Ashad Kabir},
journal= {arXiv preprint arXiv:2501.05209},
year = {2025}
}
备注
30 pages