中文

少即是多:基于稀疏采样的视频与语言学习模型 ClipBERT

计算机视觉与模式识别 2021-02-12 v1 计算与语言

摘要

视频与语言学习(如视频问答)的典型方法要求神经模型从视觉模型离线提取的稠密视频特征以及语言模型提取的文本特征中学习。这些特征提取器独立训练,且通常在不同于目标领域的任务上训练,使得这些固定特征对下游任务而言是次优的。此外,由于稠密视频特征的高计算开销,通常难以(或不可行)将特征提取器直接接入现有方法以进行简便的微调。为缓解这一困境,我们提出通用框架 ClipBERT,通过采用稀疏采样——在每步训练中仅使用视频中单个或少数稀疏采样的短片段——来实现视频与语言任务的负担得起的端到端学习。在六个数据集上的文本到视频检索与视频问答实验表明,ClipBERT 优于(或与)利用完整长度视频的现有方法相当,说明仅用少数稀疏采样片段的端到端学习往往比使用从完整视频稠密提取的离线特征更准确,印证了“少即是多”的箴言。数据集中的视频来自差异显著的领域与长度,从 3 秒的通用领域 GIF 视频到 180 秒的 YouTube 人类活动视频,显示了我们方法的泛化能力。我们提供了全面的消融研究与透彻分析,以剖析促成这一成功的关键因素。我们的代码公开于 https://github.com/jayleicn/ClipBERT

关键词

引用

@article{arxiv.2102.06183,
  title  = {Less is More: ClipBERT for Video-and-Language Learning via Sparse Sampling},
  author = {Jie Lei and Linjie Li and Luowei Zhou and Zhe Gan and Tamara L. Berg and Mohit Bansal and Jingjing Liu},
  journal= {arXiv preprint arXiv:2102.06183},
  year   = {2021}
}

备注

12 pages, 5 figures, 11 tables. - Happy Chinese New Year!