VideoGameBunny:面向视频游戏的视觉助手
计算机视觉与模式识别
2024-07-23 v1 软件工程
摘要
大型多模态模型(LMM)在从日常任务中的个人协助到医疗诊断等高级应用方面具有巨大的潜力。然而,它们在视频游戏领域的能力存在局限,如场景理解困难、幻觉以及对视频游戏内容的描述不准确,尤其是针对开源模型。本文描述了VideoGameBunny的开发,该模型基于Bunny,采用LLaVA风格,专为理解视频游戏图像而设计。我们发布了中间检查点、训练日志以及包括185,259张来自413个游戏标题的视频游戏图像,以及389,565组包含图像描述、问答对以及16个元素(涵盖136,974张图像)的JSON表示的图像指令对。我们的实验表明,高质量的游戏相关数据可能使相对较小的模型在参数数量上超过4倍的领先状态模型LLaVa-1.6-34b。我们的研究为未来的视频游戏理解研究铺平了道路,涉及游戏、解说和调试等任务。代码和数据可在https://videogamebunny.github.io/获取。
引用
@article{arxiv.2407.15295,
title = {VideoGameBunny: Towards vision assistants for video games},
author = {Mohammad Reza Taesiri and Cor-Paul Bezemer},
journal= {arXiv preprint arXiv:2407.15295},
year = {2024}
}