ECLIPSE:基于视觉与听觉的高效长视频检索
计算机视觉与模式识别
2022-08-03 v3 人工智能
计算与语言
声音
音频与语音处理
摘要
我们提出了一种用于长程文本到视频检索的音视频方法。与先前为短视频检索(例如时长5-15秒)设计的方法不同,我们的方法旨在检索捕捉复杂人类动作的分钟级长视频。仅使用视频的标准方法面临的一个挑战是,处理此类长视频中数百个密集提取帧所带来的巨大计算成本。为解决此问题,我们提出用紧凑的音频线索替换部分视频,这些线索能简洁地概括动态音频事件且处理成本低。我们的方法名为ECLIPSE(带声音编码的高效CLIP),通过将流行的CLIP模型适配到音视频视频场景,加入一个统一的音视频transformer模块来捕获来自视频和音频流的互补线索。与长程仅视频方法相比,我们的方法不仅快2.92倍、内存效率高2.34倍,还在ActivityNet、QVHighlights、YouCook2、DiDeMo和Charades等多个不同的长程视频数据集上取得了更好的文本到视频检索精度。
引用
@article{arxiv.2204.02874,
title = {ECLIPSE: Efficient Long-range Video Retrieval using Sight and Sound},
author = {Yan-Bo Lin and Jie Lei and Mohit Bansal and Gedas Bertasius},
journal= {arXiv preprint arXiv:2204.02874},
year = {2022}
}
备注
ECCV 2022 Oral project page: https://yanbo.ml/project_page/eclipse/