$\mathtt{M^3VIR}$:大规模多模态多视角合成基准数据集用于图像修复与内容创作
计算机视觉与模式识别
2025-11-03 v2
摘要
游戏与娱乐产业正快速演进,驱动沉浸式体验与生成式 AI (GAI) 技术的融合。有效训练此类模型需要大规模数据集,以捕捉游戏环境的多样性与情境。然而,现有数据集常限于特定领域,或依赖人工退化,难以真实反映游戏内容的独特性。此外,针对可控视频生成的基准测试也缺席。为此,我们引入 ,一个大规模、多模态、多视角数据集,旨在克服当前资源的局限性。不同于现有数据集, 提供了多样化、高保真度的游戏内容,采用 Unreal Engine 5 渲染,覆盖 80 个场景的 8 个类别,提供真实的 LR-HR 配对及多视角帧。它包含 用于超分辨率 (SR)、新视角合成 (NVS) 以及组合 NVS+SR 任务,以及 ——首个多风格、对象级真实基准集合,支持可控视频生成研究。我们对多种最先进的 SR 与 NVS 方法进行基准测试,建立性能基准。尽管现有方法无法直接处理可控视频生成, 提供了该领域的基准。通过发布数据集,我们旨在推动 AI 驱动的修复、压缩及可控内容生成技术在下一代云游戏与娱乐中的应用。
关键词
引用
@article{arxiv.2509.16873,
title = {$\mathtt{M^3VIR}$: A Large-Scale Multi-Modality Multi-View Synthesized Benchmark Dataset for Image Restoration and Content Creation},
author = {Yuanzhi Li and Lebin Zhou and Nam Ling and Zhenghao Chen and Wei Wang and Wei Jiang},
journal= {arXiv preprint arXiv:2509.16873},
year = {2025}
}