DC-ViT:调制空间与通道互动的多通道视觉变换器
计算机视觉与模式识别
2026-03-17 v1
摘要
多通道成像 (MCI) 中的训练和评估仍面临着由于染色方案、传感器类型和获取设置的异构通道配置导致的挑战。这种异构性限制了常见于一般计算机视觉中的固定通道编码器的适用性。最近的多通道视觉变换器 (MC-ViT) 通过在统一注意力空间中联合编码所有通道的 patch token 来实现灵活的通道输入。然而,跨通道的无限制 token 交互可能导致特征稀释,降低在 MCI 数据中保持通道特定语义的能力。为此,我们提出了解耦视觉变换器 (DC-ViT),通过解耦自注意力 (DSA) 显式调节信息共享,DSA 将 token 更新分解为两个互补的路径:空间更新建模类内结构,通道更新自适应整合跨通道信息。这种解耦可缓解信息塌陷,同时允许选择性的跨通道交互。为进一步利用这些增强的通道特定表示,我们引入了解耦聚合 (DAG),使模型能够学习任务特定的通道重要性。跨三个 MCI 基准的大量实验表明,DC-ViT 持续优于现有 MC-ViT 方法。
引用
@article{arxiv.2603.14281,
title = {DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images},
author = {Umar Marikkar and Syed Sameed Husain and Muhammad Awais and Sara Atito},
journal= {arXiv preprint arXiv:2603.14281},
year = {2026}
}