VTD-CLIP:通过提示 CLIP 实现视频到文本离散化
计算机视觉与模式识别
2025-03-26 v2
摘要
视觉语言模型桥接视觉与语言理解,已被证明是视频识别任务的强大工具。现有方法主要依赖对图像文本预训练模型的参数高效微调,然而由于时序建模不足,往往 suffers from 可解释性有限和泛化性差。为此,我们提出一种简单而有效的视频到文本离散化框架。该方法利用冻结文本编码器构建视觉词典表,因为多模态预训练中视觉和文本嵌入之间存在许多对一的对齐方式。该词典表通过特征查找有效地将时序视觉数据转换为文本标记,并通过显式视频建模提供可解释的视频表示。随后,为增强对无关或噪声帧的鲁棒性,我们引入置信感知融合模块,通过词典表评估关键帧的语义相关性,从而动态加权关键帧。此外,我们方法融入可学习的文本提示,以进行自适应词典表更新。针对 HMDB-51、UCF-101、SSv2 和 Kinetics-400 上的大量实验验证了我们方法的优越性,实现了对最先进方法的更具竞争力的提升。代码将在 https://github.com/isxinxin/VTD-CLIP 上公开。
引用
@article{arxiv.2503.18406,
title = {Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning},
author = {Sherry X. Chen and Misha Sra and Pradeep Sen},
journal= {arXiv preprint arXiv:2503.18406},
year = {2025}
}
备注
Computer Vision and Pattern Recognition 2025