中文

DepthFormer:用于基于 Transformer 的分割网络的多模态位置编码与跨输入注意力

计算机视觉与模式识别 2023-03-28 v2

摘要

大多数语义分割方法仅使用彩色相机的信息来解析场景,然而最近的进展表明,使用深度数据可进一步提高性能。在这项工作中,我们关注基于 transformer 的深度学习架构,其已在分割任务上取得最先进性能,并提议通过将深度信息嵌入位置编码中来利用深度信息。有效地,我们在不添加任何参数且以自然方式扩展网络至多模态数据,该方式利用了 transformer 自注意力模块的优势。我们还研究了在注意力模块内执行跨模态操作的想法,在深度与彩色分支间交换键输入。我们的方法在 Cityscapes 基准上一致地改进了性能。

关键词

引用

@article{arxiv.2211.04188,
  title  = {DepthFormer: Multimodal Positional Encodings and Cross-Input Attention for Transformer-Based Segmentation Networks},
  author = {Francesco Barbato and Giulia Rizzoli and Pietro Zanuttigh},
  journal= {arXiv preprint arXiv:2211.04188},
  year   = {2023}
}

备注

Accepted at ICASSP 2023