中文

CATCH:一种模块化的跨域自适应模板带钩子

计算机视觉与模式识别 2025-10-31 v1

摘要

近期在视觉问答(VQA)方面的进展已在自然图像领域展现出惊人的性能,诸如 LLaVA 等模型正利用大语言模型(LLM)实现开放式推理。然而,这些模型在迁移到远程感知、医学成像或数学图表等跨域场景时,泛化性能会显著下降,这源于分布性偏移的大规模,以及缺乏有效的域适应机制。现有方法通常依赖于单域微调或专用管道,这些方法成本高昂、灵活性差,且难以跨越多样化任务实现可扩展。本文提出 CATCH,一个即插即用的跨域适应框架,提升 VQA 模型的泛化能力,同时对其核心架构所需的修改极少。我们的核心思想是通过引入两个轻量级模块来解耦视觉与语言适应:一个用于识别输入图像类型的域分类器,以及一个由 Prompt Adapter(用于语言调制)和 Visual Adapter(用于视觉特征调整)构成的双适配器机制。这两个模块通过统一的钩子接口动态注入,无需对背板模型进行重新训练。实验结果表明,在四个领域特定 VQA 基准测试中,本框架无需重新训练背板模型即可实现一致的性能提升,包括在 MathVQA 上的 +2.3 BLEU、MedVQA-RAD 上的 +2.6 VQE 以及 ChartQA 上的 +3.1 ROUGE。这些结果表明 CATCH 提供了一种可扩展且可持久化的多域 VQA 方法,使其能够在多样化应用领域中实现实际部署。

关键词

引用

@article{arxiv.2510.26582,
  title  = {CATCH: A Modular Cross-domain Adaptive Template with Hook},
  author = {Xinjin Li and Yulie Lu and Jinghan Cao and Yu Ma and Zhenglin Li and Yeyang Zhou},
  journal= {arXiv preprint arXiv:2510.26582},
  year   = {2025}
}