基于轻量Transformer的鱼类关键点检测模型
计算机视觉与模式识别
2022-09-14 v1
摘要
基于Transformer的模型(如Vision Transformer (ViT))在有充足训练数据时,可在某些视觉任务上优于卷积神经网络(CNNs)。然而,CNNs对视觉任务具有强大且有用的归纳偏置(即平移等变性与局部性)。本工作中,我们开发了一种称为移动端鱼类关键点检测网络(MFLD-net)的新型模型架构。该模型基于ViT(即块嵌入、多层感知机)使用卷积操作构建。MFLD-net在数据量少的场景下可取得有竞争力或更优的结果,且轻量,因此适用于嵌入式与移动设备。此外,我们表明MFLD-net在鱼类图像数据集上取得的关键点(地标)估计精度可与部分最先进CNNs持平甚至更优。另外,与ViT不同,MFLD-net无需预训练模型,且在小数据集上训练时泛化良好。我们提供了定量与定性结果以展示模型的泛化能力。本工作将为未来开发移动且高效的鱼类监测系统与设备奠定基础。
引用
@article{arxiv.2209.05777,
title = {A lightweight Transformer-based model for fish landmark detection},
author = {Alzayat Saleh and David Jones and Dean Jerry and Mostafa Rahimi Azghadi},
journal= {arXiv preprint arXiv:2209.05777},
year = {2022}
}
备注
9 pages, 8 figures. Submitted to the Computers and Electronics in Agriculture journal