中文

DarSwin:感知畸变的径向 Swin Transformer

计算机视觉与模式识别 2024-07-25 v5

摘要

广角镜头常用于需要大视场的感知任务。遗憾的是,这些镜头会产生显著的畸变,使得忽略畸变效应的常规模型无法适应广角图像。本文提出一种基于 Transformer 的新模型,可自动适应广角镜头产生的畸变。我们提出的图像编码器架构称为 DarSwin,利用由径向畸变轮廓解析定义的此类镜头的物理特性。与常规基于 Transformer 的架构不同,DarSwin 包含径向图像块划分、用于创建 token 嵌入的基于畸变的采样技术,以及用于径向图像块合并的角度位置编码。与其他基线相比,DarSwin 在不同数据集上取得最佳结果,在有限畸变等级(极低、低、中、高)上训练并在所有等级(包括分布外畸变)上测试时增益显著。虽然基础 DarSwin 架构需要径向畸变轮廓的知识,我们展示其可与自标定网络结合,该网络从输入图像本身估计此类轮廓,从而形成完全未标定的流程。最后,我们还提出 DarSwin-Unet,将 DarSwin 扩展为适用于像素级任务的编码器-解码器架构。我们展示了其在深度估计上的性能,并通过大量实验表明 DarSwin-Unet 能对不同的广角镜头未见畸变进行零样本适应。代码与模型公开于 https://lvsn.github.io/darswin/

关键词

引用

@article{arxiv.2304.09691,
  title  = {DarSwin: Distortion Aware Radial Swin Transformer},
  author = {Akshaya Athwale and Arman Afrasiyabi and Justin Lagüe and Ichrak Shili and Ola Ahmad and Jean-François Lalonde},
  journal= {arXiv preprint arXiv:2304.09691},
  year   = {2024}
}

备注

18 pages, 12 figures