中文

从像素到标题:基于卷积神经网络的游戏截图识别

计算机视觉与模式识别 2025-01-09 v3 神经与进化计算

摘要

本文研究通过单张截图进行视频游戏识别,使用了十种卷积神经网络(CNN)架构(VGG16、ResNet50、ResNet152、MobileNet、DenseNet169、DenseNet201、EfficientNetB0、EfficientNetB2、EfficientNetB3 和 EfficientNetV2S)与三种 transformer 架构(ViT-B16、ViT-L32 和 SwinT),涵盖 22 个家用主机系统,从 Atari 2600 到 PlayStation 5,总计 8,796 款游戏与 170,881 张截图。除 VGG16 外,所有 CNN 在此任务中均优于 transformers。使用 ImageNet 预训练权重作为初始权重,EfficientNetV2S 取得最高平均准确率(77.44%)并在 22 个系统中的 16 个取得最高准确率。DenseNet201 在四个系统中最佳,EfficientNetB3 在剩余两个系统中最佳。采用在街机截图数据集中微调的替代初始权重提升了 EfficientNet 架构的准确率,其中 EfficientNetV2S 达到峰值准确率 77.63%,并将平均收敛轮次从 26.9 降至 24.5。总体而言,最优架构与权重的组合达到了 78.79% 的准确率,主要由 EfficientNetV2S 在 15 个系统中领先。这些发现凸显了 CNN 在通过截图进行视频游戏识别中的有效性。

关键词

引用

@article{arxiv.2311.15963,
  title  = {From Pixels to Titles: Video Game Identification by Screenshots using Convolutional Neural Networks},
  author = {Fabricio Breve},
  journal= {arXiv preprint arXiv:2311.15963},
  year   = {2025}
}