Perception Test 2025:挑战总结与统一 VQA 扩展
计算机视觉与模式识别
2026-04-30 v2
摘要
Perception Test 挑战在 2025 年 IEEE/CVF 国际计算机视力会议(ICCV 2025)旁边举办的为期一天的工作坊。其主要目标是基准测试最新视频模型并衡量多模态感知的进展。今年,工作坊包括两个 guest track:KiVA(图像理解挑战)和 Physic-IQ(视频生成挑战)。本报告总结了主要 Perception Test 挑战的结果,详细介绍了现有任务以及对基准的新 additions。在本迭代中,我们强调了任务统一化,因为这对当前最新的多模态模型构成更具挑战性的测试。该挑战包括五个综合 track:统一视频 QA、统一目标和点跟踪、统一动作和声音 localisation、grounded video QA 和小时级视频 QA,另外有一个仍然开放接受提交的分析和可解释性 track。值得注意的是,统一视频 QA track 引入了一套新子集,将传统感知任务(如点跟踪和时间动作 localisation)重新表述为 video-language 模型能够原生处理的多选 video QA 题目。统一目标和点跟踪合并了原始目标跟踪和点跟踪任务,统一动作和声音 localisation 合并了原始时间动作 localisation 和时间声音 localisation track。 accordingly,我们要求竞争者使用统一方法,而不是针对特定任务的模型的工程化管道。通过提出这样的统一挑战,Perception Test 2025 凸显了现有模型在通过统一接口应对多样化感知任务方面的显著困难。
引用
@article{arxiv.2601.06287,
title = {Perception Test 2025: Challenge Summary and a Unified VQA Extension},
author = {Joseph Heyward and Nikhil Parthasarathy and Tyler Zhu and Aravindh Mahendran and João Carreira and Dima Damen and Andrew Zisserman and Viorica Pătrăucean},
journal= {arXiv preprint arXiv:2601.06287},
year = {2026}
}