中文

HRTransNet:基于 HRFormer 驱动的双模态显著目标检测

计算机视觉与模式识别 2023-01-25 v1

摘要

高分辨率 Transformer(HRFormer)能够保持高分辨率表示并共享全局感受野。它对于输入与输出分辨率相同的显著目标检测(SOD)十分友好。然而,双模态 SOD 有两个关键问题需要解决。其一是双模态融合。其二是 HRFormer 输出的融合。针对第一个问题,通过全局优化与注意力机制在输入层级将辅助模态注入主模态以筛选并纯化模态。为解决第二个问题,使用双向短连接融合模块优化 HRFormer 的输出特征,从而在输出层级增强物体的细节表示。所提模型名为 HRTransNet,首先引入辅助流用于辅助模态的特征提取。接着,在各多分辨率分支起始处将特征注入主模态。然后,应用 HRFormer 实现前向传播。最后,所有不同分辨率的输出特征通过帧内与帧间交互 transformer 聚合。该模型的应用为驱动双模态 SOD 任务(如 RGB-D、RGB-T 与光场 SOD)带来了显著提升。https://github.com/liuzywen/HRTransNet

关键词

引用

@article{arxiv.2301.03036,
  title  = {HRTransNet: HRFormer-Driven Two-Modality Salient Object Detection},
  author = {Bin Tang and Zhengyi Liu and Yacheng Tan and Qian He},
  journal= {arXiv preprint arXiv:2301.03036},
  year   = {2023}
}