中文

面向多数据模态的 AI 生成内容(AIGC):综述

计算机视觉与模式识别 2025-01-22 v5

摘要

AI 生成内容(AIGC)方法旨在利用 AI 算法生成文本、图像、视频、3D 资产及其他媒体。因其广泛应用及近期工作的潜力,AIGC 的发展——尤其在机器学习(ML)与深度学习(DL)中——已引起显著关注,本综述聚焦于全面回顾 ML/DL 中的此类进展。AIGC 方法已针对多种数据模态发展,如图像、视频、文本、3D 形状、3D 场景、3D 人体化身、3D 运动与音频——各自呈现独特特性与挑战。此外,跨模态 AIGC 方法已取得显著进展,此类生成方法以某一模态为条件输入并产生另一模态的输出,例如从多种模态到图像、视频、3D 与音频。本文全面回顾了跨不同数据模态的 AIGC 方法,涵盖单模态与跨模态方法,凸显各设定下的各类挑战、代表性工作与近期技术方向。我们还调研了各模态中的代表性数据集,并给出多种模态的对比结果。此外,我们讨论了 AIGC 方法在各领域的典型应用、挑战与未来研究方向。

关键词

引用

@article{arxiv.2308.14177,
  title  = {AI-Generated Content (AIGC) for Various Data Modalities: A Survey},
  author = {Lin Geng Foo and Hossein Rahmani and Jun Liu},
  journal= {arXiv preprint arXiv:2308.14177},
  year   = {2025}
}