中文

ConSept:基於適配器視覺變換器的持續語義分割

计算机视觉与模式识别 2024-02-27 v1

摘要

在本文中,我們深入探討視覺變換器在持續語義分割領域的應用,這是一個在以往文獻中尚未得到充分探索的問題。對現有框架適應普通 ViT 的實證研究表明,將視覺適配器融入 ViT 或利用蒸馏項微調 ViT 有利於增強對新類別的分割能力。這些發現激勵我們提出了基於適配器 ViT 的持續語義分割方法,即 ConSept。在帶有線性分割頭的簡化 ViT 架構中,ConSept 將輕量級的基於注意力的適配器集成到普通 ViT 中。利用這些適配器的特徵適應能力,ConSept 不僅保留了對舊類別的優越分割能力,還為新類別實現了有希望的分割質量。為了進一步利用 ConSept 內在的抗災難性遺忘能力,同時增強對舊類和新類的分割能力,我們提出了兩項關鍵策略:具有確定性舊類邊界的蒸馏以改進抗災難性遺忘,以及雙 Dice 損失以正則化分割圖,從而提高整體分割性能。大量實驗表明,ConSept 在重疊或非重疊設置下的多個持續語義分割基準測試中均有效。代碼將公開於 \url{https://github.com/DongSky/ConSept}。

关键词

引用

@article{arxiv.2402.16674,
  title  = {ConSept: Continual Semantic Segmentation via Adapter-based Vision Transformer},
  author = {Bowen Dong and Guanglei Yang and Wangmeng Zuo and Lei Zhang},
  journal= {arXiv preprint arXiv:2402.16674},
  year   = {2024}
}