中文

WAVER:通过开放词汇知识蒸馏视觉语言模型实现写作风格无关的文本-视频检索

计算机视觉与模式识别 2024-06-04 v3 人工智能

摘要

文本-视频检索是多模态信息检索领域的一个重要子领域,近年来取得了显著发展。然而,现有方法假设视频场景与无偏描述一致。这些局限性无法与现实场景对齐,因为描述会受到标注者偏差、多样化写作风格和不同文本视角的影响。为了克服上述问题,我们引入了 WAVER\texttt{WAVER},这是一个通过视觉语言模型利用开放词汇知识进行跨域知识蒸馏的框架,旨在应对视频描述中不同写作风格的挑战。WAVER\texttt{WAVER} 利用预训练视觉语言模型中蕴含的开放词汇特性,采用隐式知识蒸馏方法将基于文本的知识从教师模型迁移到基于视觉的学生模型。在四个标准基准数据集上进行的跨多种设置的实证研究提供了有力证据,表明 WAVER\texttt{WAVER} 在处理写作风格变化的同时,能够在文本-视频检索任务中达到 SOTA 性能。代码可在以下地址获取:https://github.com/Fsoft-AIC/WAVER

关键词

引用

@article{arxiv.2312.09507,
  title  = {WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge},
  author = {Huy Le and Tung Kieu and Anh Nguyen and Ngan Le},
  journal= {arXiv preprint arXiv:2312.09507},
  year   = {2024}
}

备注

Accepted to ICASSP 2024