中文

$\mathtt{M^3VIR}$:大规模多模态多视角合成基准数据集用于图像修复与内容创作

计算机视觉与模式识别 2025-11-03 v2

摘要

游戏与娱乐产业正快速演进,驱动沉浸式体验与生成式 AI (GAI) 技术的融合。有效训练此类模型需要大规模数据集,以捕捉游戏环境的多样性与情境。然而,现有数据集常限于特定领域,或依赖人工退化,难以真实反映游戏内容的独特性。此外,针对可控视频生成的基准测试也缺席。为此,我们引入 M3VIR\mathtt{M^3VIR},一个大规模、多模态、多视角数据集,旨在克服当前资源的局限性。不同于现有数据集,M3VIR\mathtt{M^3VIR} 提供了多样化、高保真度的游戏内容,采用 Unreal Engine 5 渲染,覆盖 80 个场景的 8 个类别,提供真实的 LR-HR 配对及多视角帧。它包含 M3VIR_MR\mathtt{M^3VIR\_MR} 用于超分辨率 (SR)、新视角合成 (NVS) 以及组合 NVS+SR 任务,以及 M3VIR_MS\mathtt{M^3VIR\_{MS}}——首个多风格、对象级真实基准集合,支持可控视频生成研究。我们对多种最先进的 SR 与 NVS 方法进行基准测试,建立性能基准。尽管现有方法无法直接处理可控视频生成,M3VIR\mathtt{M^3VIR} 提供了该领域的基准。通过发布数据集,我们旨在推动 AI 驱动的修复、压缩及可控内容生成技术在下一代云游戏与娱乐中的应用。

关键词

引用

@article{arxiv.2509.16873,
  title  = {$\mathtt{M^3VIR}$: A Large-Scale Multi-Modality Multi-View Synthesized Benchmark Dataset for Image Restoration and Content Creation},
  author = {Yuanzhi Li and Lebin Zhou and Nam Ling and Zhenghao Chen and Wei Wang and Wei Jiang},
  journal= {arXiv preprint arXiv:2509.16873},
  year   = {2025}
}