通过一致提示调谐实现文本作为任意模态的零样本分类
计算机视觉与模式识别
2025-08-11 v1
摘要
提示调谐与多模态学习的集成在各种下游任务中显示出显著的泛化能力.尽管已有进展,但现有方法严重依赖大量模态特定标记数据(如视频、音频和图像),或针对单一模态进行定制.本研究提出Text as Any-Modality by Consistent Prompt Tuning (TaAM-CPT),一种面向无限模态的通用表示模型构建方法,仅使用文本数据即可实现. TaAM-CPT 包括模态提示池、文本构建和来自预训练模型的模态对齐文本编码器,这允许通过仅添加提示池和模态对齐文本编码器来扩展新模态.为在不同模态之间实现学习和谐,TaAM-CPT 设计了类内和类间学习目标,可在捕获模态内部类别细节的同时保持不同模态间语义一致性.凭借其可扩展架构和预训练模型,TaAM-CPT 可以无缝扩展以容纳无限模态.令人惊讶的是,在无任何模态特定标记数据的情况下,TaAM-CPT 在涵盖视频分类、图像分类和音频分类等多样数据集上实现了领先结果.代码已公开于 https://github.com/Jinx630/TaAM-CPT.
引用
@article{arxiv.2508.06382,
title = {Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning},
author = {Xiangyu Wu and Feng Yu and Yang Yang and Jianfeng Lu},
journal= {arXiv preprint arXiv:2508.06382},
year = {2025}
}
备注
Accepted for publication at ACMMM 2025