中文

VTD-CLIP:通过提示 CLIP 实现视频到文本离散化

计算机视觉与模式识别 2025-03-26 v2

摘要

视觉语言模型桥接视觉与语言理解,已被证明是视频识别任务的强大工具。现有方法主要依赖对图像文本预训练模型的参数高效微调,然而由于时序建模不足,往往 suffers from 可解释性有限和泛化性差。为此,我们提出一种简单而有效的视频到文本离散化框架。该方法利用冻结文本编码器构建视觉词典表,因为多模态预训练中视觉和文本嵌入之间存在许多对一的对齐方式。该词典表通过特征查找有效地将时序视觉数据转换为文本标记,并通过显式视频建模提供可解释的视频表示。随后,为增强对无关或噪声帧的鲁棒性,我们引入置信感知融合模块,通过词典表评估关键帧的语义相关性,从而动态加权关键帧。此外,我们方法融入可学习的文本提示,以进行自适应词典表更新。针对 HMDB-51、UCF-101、SSv2 和 Kinetics-400 上的大量实验验证了我们方法的优越性,实现了对最先进方法的更具竞争力的提升。代码将在 https://github.com/isxinxin/VTD-CLIP 上公开。

关键词

引用

@article{arxiv.2503.18406,
  title  = {Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning},
  author = {Sherry X. Chen and Misha Sra and Pradeep Sen},
  journal= {arXiv preprint arXiv:2503.18406},
  year   = {2025}
}

备注

Computer Vision and Pattern Recognition 2025