中文

基于空间感知与语义感知令牌对齐的跨域检测 Transformer

计算机视觉与模式识别 2022-06-02 v1

摘要

诸如 DETR 之类的检测 transformer 近期在许多目标检测任务上展现出良好性能,但这类方法在跨域自适应场景下的泛化能力仍颇具挑战。为解决跨域问题,一种直观做法是在 transformer 中通过对抗训练进行令牌对齐。然而,其性能常不尽如人意,因为检测 transformer 中的令牌十分多样,且代表不同的空间与语义信息。本文提出一种称为空间感知与语义感知令牌对齐(SSTA)的跨域检测 transformer 新方法。具体而言,我们利用检测 transformer 中交叉注意力的特性,提出空间感知令牌对齐(SpaTA)与语义感知令牌对齐(SemTA)策略以引导跨域令牌对齐。对于空间感知令牌对齐,我们从交叉注意力图(CAM)提取信息,依据令牌对目标查询的注意力来对齐其分布。对于语义感知令牌对齐,我们将类别信息注入交叉注意力图并构建域嵌入,以引导多类判别器的学习,从而在整体自适应过程中建模类别关系并实现类别级令牌对齐。我们在多个广泛使用的基准上进行了充分实验,结果清晰表明所提方法相对于现有 SOTA 基线的有效性。

关键词

引用

@article{arxiv.2206.00222,
  title  = {Cross-domain Detection Transformer based on Spatial-aware and Semantic-aware Token Alignment},
  author = {Jinhong Deng and Xiaoyue Zhang and Wen Li and Lixin Duan},
  journal= {arXiv preprint arXiv:2206.00222},
  year   = {2022}
}

备注

Technical report