中文

破解多模态提示调优中的隐式模态缩减瓶颈

计算机视觉与模式识别 2026-05-26 v1

摘要

在实际环境中部署多模态系统常需处理模态缺失场景,即一种或多种模态不可用的情况。虽然最近的研究通过提示调优针对通用多模态Transformer (MT) 架构解决此挑战,但我们发现这些方法存在根本性限制:隐式模态缩减瓶颈。仅基于观察到的模态条件化提示,导致这些方法不慎将MT的推理范围限制在模态缩减的子空间中,切断了对缺失模态潜在信息源的访问。为克服这一限制,我们提出了AOEPT,首次提出一种新型的模态上下文化提示方法。具体而言,我们引入轻量级模态上下文化提示(MCPs),从训练数据中提炼全局模态先验,作为缺失模态信息源的潜在存储库。基于剩余模态,这些MCPs被实例化为针对每个样本的实例感知提示,从而选择性地增强缺失模态信息,恢复MT在观察模态子空间之外的推理范围。跨各种多模态基准和骨干网络的实验表明,AOEPT性能卓越,计算开销最小。

引用

@article{arxiv.2605.24816,
  title  = {AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning},
  author = {Jian Lang and Rongpei Hong and Ting Zhong and Fan Zhou},
  journal= {arXiv preprint arXiv:2605.24816},
  year   = {2026}
}

备注

20 pages, Accepted by ICML 2026, Code is available from https://github.com/Jian-Lang/AOEPT