ViLCo-Bench:视频语言持续学习基准
人工智能
2024-12-17 v3 计算机视觉与模式识别
摘要
视频语言持续学习涉及持续适应来自视频和文本输入的信息,增强模型处理新任务同时保留先前知识的能力。该领域是一个相对未被充分探索的领域,建立合适的数据集对于促进该领域的交流和研究至关重要。在本研究中,我们提出了第一个专门的基准 ViLCo-Bench,旨在评估跨一系列视频文本任务的持续学习模型。该数据集包含从公开数据集中收集的十分钟长视频和相应的语言查询。此外,我们引入了一种新颖的内存高效框架,该框架结合了自监督学习并模拟了长期和短期记忆效应。该框架解决了包括长视频片段的内存复杂性、开放查询的自然语言复杂性以及文本-视频错位等挑战。我们认为,与现有的持续学习基准相比,ViLCo-Bench 具有更高的复杂性,将成为探索视频语言领域的关键工具,其应用范围超越了传统的类增量任务,并解决了复杂且标注有限的问题。整理好的数据、评估以及我们的新方法可在 https://github.com/cruiseresearchgroup/ViLCo 获取。
引用
@article{arxiv.2406.13123,
title = {ViLCo-Bench: VIdeo Language COntinual learning Benchmark},
author = {Tianqi Tang and Shohreh Deldari and Hao Xue and Celso De Melo and Flora D. Salim},
journal= {arXiv preprint arXiv:2406.13123},
year = {2024}
}
备注
14 pages, 4 figures, 8 tables, Accepted at NeurIPS Dataset and Benchmark Track 2024