对齐您的查询:多模态医学目标检测中的表示对齐
计算机视觉与模式识别
2026-04-01 v2 人工智能
机器学习
摘要
单一检测器在混合医学模态(如胸片、CT、MRI)上训练时,由于统计特性异质和表示空间 disjoint,存在医学目标检测性能下降的问题。为此,我们转向表示对齐技术,这一方法已被证明有效地将来自不同来源的特征引入共享空间。具体而言,我们针对 DETR 风格对象查询的表示,提出一个简单且与检测器无关的框架,通过模块化上下文注意力(Multimodality Context Attention, MoCA)将其与模态上下文对齐。首先,我们定义模态标记:由文本派生的紧凑嵌入,编码成像模态,具有轻量级且无需额外标注。我们通过 MoCA 将模态标记集成到检测过程中,通过自注意力机制混合对象查询表示,以在查询集合内部传递模态上下文。这既保留了 DETR 风格的架构,又在注入模态线索的同时几乎不增加延迟。我们进一步引入 QueryREPA,即一种短期预训练阶段,通过基于对比学习目标将查询表示对齐到其模态标记,使用模态平衡 batch。结合 MoCA 和 QueryREPA,我们获得的查询在模态感知、类别忠实方面表现良好,能够有效迁移到下游训练。在 diverse 模态一起训练的情况下,所提出的方法一致性地提高 AP,开销最小且无需架构修改,为面向稳健的多模态医学目标检测提供了实用路径。
引用
@article{arxiv.2510.02789,
title = {Align Your Query: Representation Alignment for Multimodality Medical Object Detection},
author = {Ara Seo and Bryan Sangwoo Kim and Hyungjin Chung and Jong Chul Ye},
journal= {arXiv preprint arXiv:2510.02789},
year = {2026}
}
备注
Project page: https://araseo.github.io/alignyourquery/