短而又精彩:来自 2 万部短片的剧集级视频理解
计算机视觉与模式识别
2025-01-13 v2 人工智能
计算与语言
摘要
最近的视觉语言模型发展显著推进了视频理解。然而,现有数据集和任务存在诸多局限。大多数数据集局限于短视频,仅包含有限的事件和狭窄的叙事。例如,带有指令性和第三人称视角的视频数据集常 depicting 一位观众在单个场景中的活动。虽然现有的电影数据集提供了更丰富的内容,但它们常常局限于短期任务,缺乏公开可用的视频,且在使用字幕和其他关于商业电影信息进行 LLM 预训练时,经常出现数据泄露问题。为此,我们提出了 Short-Films 20K(SF20K),最大公开可用的电影数据集。SF20K 由 20,143 部业余短片组成,提供以多选题和开放式问答形式的长期视频任务。我们对 SF20K 的广泛分析揭示了最小的数据泄露,强调了长期推理的需求,并展示了近期视觉语言模型的强大性能。最后,我们表明在 SF20K-Train 集合上进行指令调优可显著提高模型性能,为未来在长期视频理解方面的进展铺平了道路。
引用
@article{arxiv.2406.10221,
title = {Long Story Short: Story-level Video Understanding from 20K Short Films},
author = {Ridouane Ghermi and Xi Wang and Vicky Kalogeiton and Ivan Laptev},
journal= {arXiv preprint arXiv:2406.10221},
year = {2025}
}