中文

元个性化视觉-语言模型以在视频中查找具名实例

计算机视觉与模式识别 2023-06-21 v1 计算与语言 机器学习

摘要

大规模视觉-语言模型(VLM)已在语言引导搜索应用中展现出令人印象深刻的成果。尽管这些模型支持类别级查询,但目前难以针对视频中特定对象实例(如“我的狗 Biscuit”)出现的时刻进行个性化搜索。我们提出以下三项贡献以解决该问题。首先,我们描述一种元个性化预训练 VLM 的方法,即学习如何在测试时个性化 VLM 以在视频中搜索。我们的方法通过为每个实例学习特定的新词嵌入来扩展 VLM 的词表。为仅捕捉实例特定特征,我们将每个实例嵌入表示为共享与习得全局类别特征的组合。其次,我们提出在无显式人类监督下学习此类个性化。我们的方法利用转录文本与 VLM 嵌入空间中的视觉-语言相似性,自动识别视频中具名视觉实例出现的时刻。最后,我们引入 This-Is-My,一个个人视频实例检索基准。我们在 This-Is-My 与 DeepFashion2 上评估了我们的方法,并表明在后者数据集上相对最先进水平获得了 15% 的提升。

关键词

引用

@article{arxiv.2306.10169,
  title  = {Meta-Personalizing Vision-Language Models to Find Named Instances in Video},
  author = {Chun-Hsiao Yeh and Bryan Russell and Josef Sivic and Fabian Caba Heilbron and Simon Jenni},
  journal= {arXiv preprint arXiv:2306.10169},
  year   = {2023}
}

备注

Accepted to CVPR 2023. Project webpage: https://danielchyeh.github.io/metaper/