SF20K 竞赛 2025:概述与发现
计算机视觉与模式识别
2026-05-05 v1
摘要
本报告介绍了首届短片 20K(SF20K)竞赛的结果与发现,该竞赛于 2025 年 ICCV 会议的 SLoMO 工作坊期间举办。该竞赛旨在推动基于叙事水平的视频理解,超越短片动作识别范式,提出了构建在业余短片语料库上的开放式视频问答任务。此设定确保模型必须依赖于多模态理解,而非依赖流行电影的记忆。评估采用 SF20K-Test 基准(95 部电影,979 对问答对),并通过基于 GPT-4.1-nano 的 LLM-QA-Eval 自动评分。该竞赛吸引了 22 支团队提交了 286 条作品,其中包括规模不限的主轨和仅限 80 亿参数以下模型的特别轨。获胜团队在主轨上取得 65.7% 的准确率,在特别轨上取得 48.7% 的准确率,人类性能上限为 91.7%。我们的分析揭示了若干关键发现:叙事感知、基于镜头级别的处理始终优于统一帧抽样;采用小型模型构建的多阶段管道可与使用 30 倍以上参数的端到端推理模型相比或更好;字幕质量是性能的决定性因素。这些结果表明,长篇视频问答的主要瓶颈在于信息选择与推理结构,而非原始模型容量;而且当前方法与人类叙事理解能力之间仍存显著鸿沟。
引用
@article{arxiv.2605.01496,
title = {SF20K Competition 2025: Summary and findings},
author = {Ridouane Ghermi and Xi Wang and Vicky Kalogeiton and Ivan Laptev},
journal= {arXiv preprint arXiv:2605.01496},
year = {2026}
}