视觉 VLM 能多远?研究 19,738 个关键帧的 41 小时游戏视频
计算机视觉与模式识别
2026-03-25 v1 软件工程
摘要
基于视频的质量保证(QA)对于长篇游戏视频具有高成本和高错误率,尽管对评估游戏稳定性和长期视觉正确性具有重要价值。视觉语言模型(VLMs)因其通用的视觉推理能力而显得富有吸引力,可直接从视频帧中检测视觉缺陷。最近的基准测试表明,VLMs 在检测精选数据集上的视觉故障方面能够实现令人鼓舞的成果。基于这些发现,我们进行了针对工业 QA 游戏视频的现实世界研究,以评估 VLMs 在实际场景中的表现。我们的研究从长篇游戏视频中抽取关键帧,并询问 VLMs 每个关键帧是否包含缺陷。从单提示基线开始,模型实现了 0.50 的精确率和 0.72 的准确率。我们 then 检查了两种常见的增强策略,用于在不进行微调的情况下提高 VLMs 的性能:(1)一个次级判官模型对 VLMs 输出进行重新评估,以及(2)通过检索先前缺陷报告的元数据增强提示。跨 \textbf{100 个视频}、\textbf{41 小时}和 \textbf{19,738 个关键帧},这些策略仅在简单基线之上提供了有限的改进,同时引入了额外的计算成本和输出波动。我们的发现表明,即插式 VLMs 已经能够检测 QA 游戏视频中一定范围的视觉缺陷,但进一步的进步可能需要更好的分离文本和视觉异常检测的混合方法。
引用
@article{arxiv.2603.22706,
title = {How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos},
author = {Wentao Lu and Alexander Senchenko and Alan Sayle and Abram Hindle and Cor-Paul Bezemer},
journal= {arXiv preprint arXiv:2603.22706},
year = {2026}
}