用于害虫图像识别的 ROI 感知多尺度交叉注意力 Vision Transformer
计算机视觉与模式识别
2025-07-11 v1
摘要
与整个图像相比,成像设备捕获的害虫可能尺寸相对较小,且复杂背景具有与害虫相似的颜色和纹理,这阻碍了准确的特征提取并使害虫识别具有挑战性。害虫识别的关键在于创建一个能够检测感兴趣区域(ROIs)并将其转化为更适合注意力和判别性学习的区域的模型。为了解决这些问题,我们将研究如何通过多尺度交叉注意力融合来生成和更新 ROIs,以及如何对复杂背景和尺度问题具有高度鲁棒性。因此,我们提出了一种新颖的 ROI 感知多尺度交叉注意力 vision transformer (ROI-ViT)。所提出的 ROI-ViT 采用双分支设计,称为 Pest 分支和 ROI 分支,它们以不同类型的映射图作为输入:害虫图像和 ROI 图。为了渲染此类 ROI 图,使用软分割和类激活图构建了 ROI 生成器,然后将其集成到 ROI-ViT 主干网络中。此外,在双分支中,通过一种新颖的多尺度交叉注意力融合实现了互补特征融合和多尺度层次结构。Pest 分支的类标记与 ROI 分支的补丁标记进行交换,反之亦然。实验结果表明,所提出的 ROI-ViT 在 IP102、D0 和 SauTeg 害虫数据集上分别达到了 81.81%、99.64% 和 84.66%,优于 MViT、PVT、DeiT、Swin-ViT 和 EfficientNet 等最先进(SOTA)模型。更重要的是,对于仅包含具有复杂背景和小尺寸害虫图像的全新挑战性数据集 IP102(CBSS),所提出的模型能够保持高识别准确率,而其他 SOTA 模型的准确率则急剧下降,这表明我们的模型对复杂背景和尺度问题更具鲁棒性。
引用
@article{arxiv.2312.16914,
title = {ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image Identification},
author = {Ga-Eun Kim and Chang-Hwan Son},
journal= {arXiv preprint arXiv:2312.16914},
year = {2025}
}