中文

EdgeNAT:一种高效边缘检测的 Transformer

计算机视觉与模式识别 2024-08-21 v1 人工智能

摘要

Transformer 以其强大的特征提取能力,在各类视觉任务中发挥越来越重要的作用。尤其,近期出现的具有层次结构的 Transformer,如 Dilated Neighborhood Attention Transformer (DiNAT),展现出高效捕获全局与局部特征的卓越能力。然而,Transformer 在边缘检测中的应用尚未得到充分挖掘。本文提出 EdgeNAT,一种基于 DiNAT 作为编码器的单阶段 Transformer 边缘检测器,能够准确且高效地提取物体边界和有意义的边缘。一方面,EdgeNAT 利用 DiNAT 捕获全局语境信息和细致的局部线索;另一方面,通过利用特征图的空间间关系和通道间关系,采用一种新颖的 SCAF-MLA 解码器来增强特征表示。多个数据集上的广泛实验表明,我们的方法在 RGB 和深度图像上均实现了最先进的性能。值得注意的是,在广泛使用的 BSDS500 数据集上,我们的 L 模型在多尺度输入下的 ODS F-measure 和 OIS F-measure 分别为 86.0% 和 87.6%,在单尺度输入下分别为 84.9% 和 86.3%,超越当前最先进的 EDTER 高出 1.2%、1.1%、1.7% 和 1.6%。此外,关于吞吐量,我们的方法在 RTX 4090 GPU 上以单尺度输入运行速度为 20.87 FPS。我们的方法代码将很快公开。

关键词

引用

@article{arxiv.2408.10527,
  title  = {EdgeNAT: Transformer for Efficient Edge Detection},
  author = {Jinghuai Jie and Yan Guo and Guixing Wu and Junmin Wu and Baojian Hua},
  journal= {arXiv preprint arXiv:2408.10527},
  year   = {2024}
}