基于提示词的视频到文本离散化:VTD-CLIP
计算机视觉与模式识别
2025-03-26 v2
摘要
视觉-语言模型桥接了视觉与语言理解,已被证明是视频识别任务的强大工具。现有方法主要依赖对图像-文本预训练模型的参数高效微调,但常因时序建模不足而导致可解释性有限和泛化性差。为此,我们提出一种简单而有效的视频到文本离散化框架。该方法利用多模态预训练中视觉与文本嵌入的许多对一对一对齐特性,借助冻结文本编码器从视频类别标签构建视觉词典表。该词典通过特征查找将时序视觉数据转换为文本标记,同时通过显式视频建模提供可解释的视频表示。为增强对无关或噪声帧的鲁棒性,我们引入置信感知融合模块,通过词典评估其语义相关性动态加权关键帧。此外,我们方法还纳入可学习的文本提示,用于进行自适应词典更新。广泛的实验在 HMDB-51、UCF-101、SSv2 和 Kinetics-400 上验证了我们方法的优越性,相较于现有方法实现了更具竞争力的提升。该代码将在 https://github.com/isxinxin/VTD-CLIP 上公开。
引用
@article{arxiv.2503.18407,
title = {VTD-CLIP: Video-to-Text Discretization via Prompting CLIP},
author = {Wencheng Zhu and Yuexin Wang and Hongxuan Li and Pengfei Zhu and Qinghua Hu},
journal= {arXiv preprint arXiv:2503.18407},
year = {2025}
}