中文

使用视觉-语言模型从游戏视频中自动检索 Bug 帧

软件工程 2025-08-08 v1

摘要

现代游戏工作室以极快的速度交付新版本和补丁,生成数千份 Bug 报告,其中许多嵌入了游戏视频。为了验证和分诊这些 Bug 报告,开发者必须观看提交的视频。这种人工审查费时费力、速度缓慢且难以扩展。在本文中,我们引入了一个自动化流水线,将每个视频缩减为与所报告的 Bug 描述最匹配的单个帧,为开发者提供即时定位该 Bug 的视觉证据。我们的流水线首先使用 FFmpeg 进行关键帧提取,将每个视频缩减至仅占其原始帧数中位数 1.90% 的帧,同时在 98.79% 的情况下仍能捕捉到 Bug 时刻。然后,这些关键帧由视觉-语言模型 (GPT-4o) 进行评估,该模型根据它们与文本 Bug 描述的匹配程度对其进行排名,并选择最具代表性的帧。我们使用真实世界中开发者提交的游戏视频以及来自一款流行第一人称射击 (FPS) 游戏的 JIRA Bug 报告对该方法进行了评估。该流水线在 top-1 检索帧上实现了 0.79 的总体 F1 分数和 0.89 的准确率。对于光照与阴影 (F1 = 0.94)、物理与碰撞 (0.86) 以及 UI 与 HUD (0.83) Bug 类别,性能最高,而对于动画与 VFX (0.51) 类别,性能最低。通过用具有即时信息量的图像代替视频观看,我们的方法显著减少了人工工作量,加快了分诊和回归检查的速度,为整个游戏行业的质量保证 (QA) 团队和开发者提供了实际收益。

关键词

引用

@article{arxiv.2508.04895,
  title  = {Automated Bug Frame Retrieval from Gameplay Videos Using Vision-Language Models},
  author = {Wentao Lu and Alexander Senchenko and Abram Hindle and Cor-Paul Bezemer},
  journal= {arXiv preprint arXiv:2508.04895},
  year   = {2025}
}