基于多模态提示的零样本与少样本视频问答
计算机视觉与模式识别
2023-09-29 v1
摘要
近期的视觉-语言模型由大规模预训练模型驱动。然而,在有限数据上适配预训练模型面临过拟合、灾难性遗忘以及视觉与语言之间的跨模态鸿沟等挑战。我们引入了一种参数高效的方法来应对这些挑战,该方法结合多模态提示学习与基于 transformer 的映射网络,同时保持预训练模型冻结。我们在多个视频问答基准上的实验证明了我们的方法在零样本和少样本设定下在性能和参数效率方面的优越性。我们的代码可在 https://engindeniz.github.io/vitis 获取。
引用
@article{arxiv.2309.15915,
title = {Zero-Shot and Few-Shot Video Question Answering with Multi-Modal Prompts},
author = {Deniz Engin and Yannis Avrithis},
journal= {arXiv preprint arXiv:2309.15915},
year = {2023}
}
备注
ICCV2023 CLVL Workshop (Oral). Project page: https://engindeniz.github.io/vitis