中文

FlowComposer:用于组合零样本学习的可组合流

计算机视觉与模式识别 2026-03-18 v1

摘要

组合零样本学习(CZSL)旨在通过重新组合从已见配对中学习的原语来识别未见属性-对象组合。基于视觉语言模型(VLMs)的近期 CZSL 方法通常采用参数高效微调(PEFT)。它们应用视觉解缠合器进行分解,并操纵 token 级别的提示或前缀来编码组合。然而,这些 PEFT-based 设计存在两个根本局限:(1) 隐式组合构建,即组合仅通过 token 拼接或分支式提示调谐来实现,而非在嵌入空间中的显式操作;(2) 仍残留特征解缠合,即不完美的解缠合留下属性、对象和组合特征相互污染。共同而言,这些问题限制了当前 CZSL 模型的泛化能力。本文我们首次系统性地研究用于 CZSL 的流匹配,引入 FlowComposer——一种模型无关的框架,学习两个原语流将视觉特征输送至属性和对象文本嵌入,以及一个可学习的 Composer 用于显式融合它们的速度场以形成组合流。为利用不可避免的残余解缠合,我们进一步设计了基于漏泄引导的增强方案,将漏泄特征用作辅助信号。我们在三个公开 CZSL 基准数据集上彻底评估 FlowComposer,将其作为可插即组件集成到各种基线方法中,始终实现显著改进。

关键词

引用

@article{arxiv.2603.16641,
  title  = {FlowComposer: Composable Flows for Compositional Zero-Shot Learning},
  author = {Zhenqi He and Lin Li and Long Chen},
  journal= {arXiv preprint arXiv:2603.16641},
  year   = {2026}
}

备注

Accepted to CVPR2026