中文

VoP:面向跨模态检索的文本-视频协同提示微调

计算机视觉与模式识别 2023-03-23 v3 人工智能 计算与语言

摘要

许多近期研究利用预训练的 CLIP 通过附加沉重模块微调主干网络来进行文本-视频跨模态检索,这不仅带来了参数量大增的沉重计算负担,还导致上游模型的知识遗忘。在本工作中,我们提出 VoP:文本-视频协同提示微调(Text-Video Co-operative Prompt Tuning),用于文本-视频检索任务的高效微调。所提出的 VoP 是一个端到端框架,引入了视频与文本提示,可视为仅含 0.1% 可训练参数的强基线。进一步,基于视频的时空特性,我们开发了三种新颖的视频提示机制,以不同规模的可训练参数提升性能。VoP 增强的基本思想分别是用特定的可训练提示对帧位置、帧上下文和层功能进行建模。大量实验表明,与全微调相比,增强的 VoP 在五个文本-视频检索基准上以 6 倍更少的参数开销取得了平均 R@1 提升 1.4% 的效果。代码将发布于 https://github.com/bighuang624/VoP。

关键词

引用

@article{arxiv.2211.12764,
  title  = {VoP: Text-Video Co-operative Prompt Tuning for Cross-Modal Retrieval},
  author = {Siteng Huang and Biao Gong and Yulin Pan and Jianwen Jiang and Yiliang Lv and Yuyuan Li and Donglin Wang},
  journal= {arXiv preprint arXiv:2211.12764},
  year   = {2023}
}

备注

Accepted by CVPR 2023