中文

CoMET:无需微调的模块化多模态分类:一种简单而高效的方法

机器学习 2026-05-21 v1

摘要

我们引入CoMET(\textbf{C}omposing \textbf{M}odality \textbf{E}ncoders with \textbf{T}abular foundation models),一种用于多模态分类的简单且高效的方法:将每个模态通过冻结的预训练主干网络处理,压缩其生成的嵌入向量(通过 PCA),然后拼接作为 Tabular Foundation Model(TFM)的输入进行预测。我们表明,PCA alone 足以作为一种适配器,提供强大且稳健的性能,能够跨模态有效工作。当 foundation model 的 \texttt{CLS} 标记与下游任务对齐不佳时,我们提出\textbf{PALPooling},一种轻量级自适应词汇池化器,持续改善表示质量。通过将强大的冻结表示学习主干网络与 TFM 组合,我们的方法在无需任何训练的情况下实现了多模态基准测试的最先进成果。对于具有大规模细粒度类别空间的层次化任务,我们的方案实现了快速且可扩展的分类,能够处理超过 50 万样本和 2000 个类别的数据集,无需任何微调。总体而言,我们的结果表明,foundation model 的组合是一种简单而强大的开箱即用解决方案,挑战了为新问题构建复杂的端到端训练管道的必要性。

关键词

引用

@article{arxiv.2605.20674,
  title  = {Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach},
  author = {Herman Bergström and Aditya Mehrotra and Rahul G. Krishnan},
  journal= {arXiv preprint arXiv:2605.20674},
  year   = {2026}
}

备注

30 pages, 17 figures