TEST-V:面向零样本视频分类的测试时支持集调谐
计算机视觉与模式识别
2025-02-11 v2
摘要
最近,通过对Vision Language Models (VLM)进行针对零样本视觉分类的调谈(Test-time Prompt Tuning, TPT)或用生成的视觉样本替换类别名称(support-set),显示出了有前景的效果。然而,TPT无法避免跨模态之间的语义差距,而support-set又无法进行调谈。为此,我们综合两者优势,提出了一种新型框架,即为零样本视频分类设计的TEst-time Support-set Tuning (TEST-V)。它首先通过多提示支持集扩张(Multi-prompting Support-set Dilation, MSD)扩大support-set,然后通过可学习权重进行支持集侵蚀(Temporal-aware Support-set Erosion, TSE),以动态挖掘关键线索。具体而言,i) MSD基于LLM查询的多个提示扩展每个类别的support样本,以丰富support-set的多样性。ii) TSE根据自监督方式中基于时间的预测一致性,对support-set进行可学习权重调谈,以挖掘每个类别的关键支撑线索。TEST-V在四个基准测试上实现了最先进的结果,并对support-set的扩张和侵蚀具有良好的可解释性。
引用
@article{arxiv.2502.00426,
title = {TEST-V: TEst-time Support-set Tuning for Zero-shot Video Classification},
author = {Rui Yan and Jin Wang and Hongyu Qu and Xiaoyu Du and Dong Zhang and Jinhui Tang and Tieniu Tan},
journal= {arXiv preprint arXiv:2502.00426},
year = {2025}
}