中文

In-Style:以风格迁移桥接文本与未筛选视频实现文本-视频检索

计算机视觉与模式识别 2023-09-19 v1

摘要

大规模含噪网络图像-文本数据集已被证明可高效学习鲁棒的视觉-语言模型。然而,当将其迁移至视频检索任务时,模型仍需在人工筛选的配对文本-视频数据上微调,以适应视频描述的多样风格。为在无人工标注配对的情况下解决该问题,我们提出一种新设定——基于未筛选且无配对数据的文本-视频检索,其在训练时仅使用文本查询与未筛选网络视频,无任何配对文本-视频数据。为此,我们提出一种方法 In-Style,学习文本查询的风格并将其迁移至未筛选网络视频。此外,为提升泛化性,我们展示了单一模型可用多种文本风格训练。为此,我们引入多风格对比训练流程,可同时在多个数据集上提升泛化能力。我们在多个数据集的检索性能上评估模型,以证明我们的风格迁移框架在未筛选且无配对文本-视频检索这一新任务上的优势,并在零样本文本-视频检索上取得优于当前最优(SOTA)的性能。

关键词

引用

@article{arxiv.2309.08928,
  title  = {In-Style: Bridging Text and Uncurated Videos with Style Transfer for Text-Video Retrieval},
  author = {Nina Shvetsova and Anna Kukleva and Bernt Schiele and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2309.08928},
  year   = {2023}
}

备注

Published at ICCV 2023, code: https://github.com/ninatu/in_style