第五届PVUW挑战赛报告:像素级理解中的更多样化模态
计算机视觉与模式识别
2026-04-30 v1
摘要
本报告总结了2026年Pixel-level Video Understanding in the Wild (PVUW) 挑战赛的目标、数据集和顶级方法,该挑战赛于CVPR 2026上举办,旨在评估在高度不受约束条件下的前沿模型。为提供全面的评估,2026年版本包含三个专门轨道:MOSE轨道用于跟踪密集杂乱且严重遮挡场景中的目标;MeViS-Text轨道用于通过以运动为焦点的语言表达式来定位目标;新设立的MeViS-Audio轨道首次实现声音驱动的对象分割。通过引入此前未公开的具有挑战性的数据并分析参赛者提交的前沿多模态解决方案,本报告突出了社区最新的技术进展,并为稳健的视频场景理解指明了有前景的未来方向。
引用
@article{arxiv.2604.26031,
title = {Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding},
author = {Chang Liu and Henghui Ding and Nikhila Ravi and Yunchao Wei and Shuting He and Song Bai and Philip Torr and Leilei Cao and Jinrong Zhang and Deshui Miao and Xusheng He and Dengxian Gong and Zhiyu Wang and Mingqi Gao and Jihwan Hong and Canyang Wu and Weili Guan and Jianlong Wu and Liqiang Nie and Xingsen Huang and Yameng Gu and Xiaogang Yu and Xin Li and Ming-Hsuan Yang and Sijie Li and Jungong Han and Quanzhu Niu and Shihao Chen and Yuanzheng Wu and Yikang Zhou and Tao Zhang and Haobo Yuan and Lu Qi and Shunping Ji and Chao Yang and Chao Tian and Guoqing Zhu and Kai Yang and Zhifan Mo and Haijun Zhang and Xudong Kang and Shutao Li and Jaeyoung Do},
journal= {arXiv preprint arXiv:2604.26031},
year = {2026}
}
备注
Official Report of the 5th PVUW Challenge on CVPR 2026