基于音视频录制的多智能体游戏生成与评估
人工智能
2025-08-04 v1 多智能体系统
多媒体
摘要
尽管 AI 在生成文本、音频、图像和视频方面表现出色,但在创建交互式音视频内容(如视频游戏)方面仍存在挑战。当前的 LLM 能够生成 JavaScript 游戏和动画,但缺乏自动化评估指标,且在需要由团队成员持续工作数月才能实现的复杂内容(多 shot、多智能体)方面困难,这些内容通常使用由艺术家制作的资产。为解决这些问题,我们构建了一个新的指标和一个多智能体系统。我们提出了 AVR-Eval,这是一个用于多媒体内容质量的相对指标,使用音视频录制(AVRs)。一个 Omni 模态模型(处理文本、视频和音频)比较两个内容的 AVRs,随后一个文本模型审查评估结果以确定优劣。我们展示了 AVR-Eval 能够正确识别优质内容与损坏或不匹配内容。我们构建了 AVR-Agent,一个多智能体系统,从多媒体资产库(音频、图像、3D 模型)生成 JavaScript 代码。编码智能体选择相关资产,生成多个初始代码,使用 AVR-Eval 识别最佳版本,并通过 Omni 模态智能体反馈迭代改进。我们在游戏和动画上进行了 AVR-Eval 实验(内容 A 对抗 B 的胜率)。我们发现通过 AVR-Agent 生成的内容在对抗单次生成的内容时胜率显著更高。然而,模型在有效利用自定义资产和 AVR 反馈方面存在挑战,胜率并未提升。这揭示了一个关键差距:尽管人类从高质量资产和音视频反馈中受益,但当前的编码模型似乎未能像人类一样有效地利用这些资源,这凸显了人类与机器内容创建方法之间的根本差异。
引用
@article{arxiv.2508.00632,
title = {Multi-Agent Game Generation and Evaluation via Audio-Visual Recordings},
author = {Alexia Jolicoeur-Martineau},
journal= {arXiv preprint arXiv:2508.00632},
year = {2025}
}