中文

FILS:语义语言空间中的自监督视频特征预测

计算机视觉与模式识别 2024-06-06 v1 人工智能 机器学习

摘要

本文展示了一种用于学习语义视频表示的自监督方法。最近的视觉研究表明,视觉和自然语言监督的掩码策略有助于开发可迁移的视觉预训练。我们的目标是通过在完全自监督的方式下利用与视频内容相关的文本,在预训练期间获得更具语义的视频表示。为此,我们提出了FILS,一种新颖的自监督视频特征预测在语义语言空间中的方法。视觉模型可以通过正确预测语言空间中的掩码特征语义来捕获有价值的结构化信息。它通过一种逐块视频-文本对比策略进行学习,其中文本表示作为原型,将视觉特征转换为语言空间,然后这些特征作为目标,用于使用我们的掩码编码器-解码器结构进行语义有意义的特征预测。FILS在下游动作识别任务上表现出显著的可迁移性,在使用ViT-Base的情况下,在具有挑战性的自我中心数据集(如Epic-Kitchens、Something-SomethingV2、Charades-Ego和EGTEA)上达到了最先进水平。与之前的工作相比,我们高效的方法需要更少的计算量和更小的批次。

关键词

引用

@article{arxiv.2406.03447,
  title  = {FILS: Self-Supervised Video Feature Prediction In Semantic Language Space},
  author = {Mona Ahmadian and Frank Guerin and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2406.03447},
  year   = {2024}
}