匹配、扩展与改进:基于语言知识的无监督微调用于零样本动作识别
计算机视觉与模式识别
2023-07-25 v2
摘要
大规模视觉-语言(VL)模型在视觉与文本模态间的表征对齐方面取得了巨大成功。这使得零样本识别、图像生成与编辑以及许多其他令人振奋的任务取得了显著进展。然而,VL模型往往过度表征物体而较少关注动词,并且需要在视频数据上额外微调以获得最佳的零样本动作识别性能。先前的工作依赖于大规模、全标注数据,而本文提出一种无监督方法。我们利用一组无标签视频和一份无配对的动作词典,将VL模型适配于零样本与少样本动作识别。在此基础上,我们借助大语言模型(LLM)与VL模型,通过匹配、文本扩展与描述生成,为每个无标签视频构建文本包。我们在多示例学习(Multiple Instance Learning)框架下使用这些文本包将图像-文本骨干网络适配到视频数据。尽管仅在无标签视频数据上微调,我们得到的模型对众多未见过的零样本下游任务表现出高可迁移性,将基础VL模型性能提升高达14%,并且在零样本与少样本视频识别迁移中甚至优于全监督基线。代码稍后将于\url{https://github.com/wlin-at/MAXI}发布。
引用
@article{arxiv.2303.08914,
title = {MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language Knowledge},
author = {Wei Lin and Leonid Karlinsky and Nina Shvetsova and Horst Possegger and Mateusz Kozinski and Rameswar Panda and Rogerio Feris and Hilde Kuehne and Horst Bischof},
journal= {arXiv preprint arXiv:2303.08914},
year = {2023}
}
备注
Accepted at ICCV 2023