中文

基于现成模型的零样本视频时刻检索

计算机视觉与模式识别 2022-11-07 v1 计算与语言

摘要

对于机器学习界的大多数研究者而言,收集高质量人工标注数据的昂贵成本,以及在有限算力下无法高效微调最先进的超大规模预训练模型,是构建新任务模型的主要瓶颈。我们针对视频时刻检索(VMR)这一任务提出了一种零样本的简单方法,该方法不进行任何额外的微调,而是直接复用在其他任务上训练好的现成模型。我们的三步法包括时刻提议、时刻-查询匹配和后处理,全部仅使用现成模型。在 QVHighlights 的 VMR 基准上,我们在所有指标上将先前零样本方法的性能大幅提升至少 2.5 倍,并将零样本与最先进监督方法之间的差距缩小超过 74%。此外,我们还表明我们的零样本方法在召回率(Recall)指标上优于非预训练的监督模型,在 mAP 指标上非常接近;并且在较短时刻上优于最佳的预训练监督模型。最后,我们对结果进行了消融与分析,并提出了有趣的未来方向。

关键词

引用

@article{arxiv.2211.02178,
  title  = {Zero-shot Video Moment Retrieval With Off-the-Shelf Models},
  author = {Anuj Diwan and Puyuan Peng and Raymond J. Mooney},
  journal= {arXiv preprint arXiv:2211.02178},
  year   = {2022}
}

备注

Accepted to the NeurIPS 2022 Workshop on Transfer Learning for NLP (TL4NLP). 12 pages, 5 figures