VALUE:一个用于视频与语言理解评估的多任务基准
计算机视觉与模式识别
2021-08-20 v2 计算与语言
摘要
大多数现有的视频与语言(VidL)研究聚焦于单一数据集,或单一任务的多个数据集。现实中,真正有用的 VidL 系统应易于泛化到多样的任务、领域和数据集。为促进此类系统的评估,我们引入了视频与语言理解评估(VALUE)基准,其汇集了 3 个流行任务上的 11 个 VidL 数据集:(i)文本到视频检索;(ii)视频问答;以及(iii)视频描述。VALUE 基准旨在覆盖广泛的视频类型、视频长度、数据量和任务难度级别。VALUE 不局限于仅含视觉信息的单通道视频,而是倡导利用视频帧及其关联字幕中信息的模型,以及跨多个任务共享知识的模型。我们评估了有无大规模 VidL 预训练的各种基线方法,并系统性地探究了视频输入通道、融合方法和不同视频表示的影响。我们还研究了任务间的可迁移性,并在不同设定下进行了多任务学习。我们最佳模型与人类表现之间的显著差距呼吁未来对先进 VidL 模型的研究。VALUE 可在 https://value-benchmark.github.io/ 获取。
引用
@article{arxiv.2106.04632,
title = {VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation},
author = {Linjie Li and Jie Lei and Zhe Gan and Licheng Yu and Yen-Chun Chen and Rohit Pillai and Yu Cheng and Luowei Zhou and Xin Eric Wang and William Yang Wang and Tamara Lee Berg and Mohit Bansal and Jingjing Liu and Lijuan Wang and Zicheng Liu},
journal= {arXiv preprint arXiv:2106.04632},
year = {2021}
}
备注
To appear in 35th Conference on Neural Information Processing Systems (NeurIPS 2021) Track on Datasets and Benchmarks