中文

UniVerse-1:通过拼接专家实现统一音视频生成

计算机视觉与模式识别 2025-09-09 v1

摘要

我们介绍 UniVerse-1,这是一个统一的、类似 Veo-3 的模型,能够同时生成协调的音频和视频。为提升训练效率,我们跳过从零训练的步骤,采用拼接专家(Stitching of Experts, SoE)技术。该方法深度融合了预训练的视频和音乐生成专家模型的相应模块,从而充分利用其基础能力。为确保两者(环境声和语音)与视频内容的准确标注和时间对齐,我们开发了在线标注管道,在训练过程中处理所需数据并生成标签。该策略规避了常见的文本标注对齐导致性能下降的问题。通过这些技术的协同作用,该模型在约 7,600 小时音视频数据上的微调后,能够为环境声生成产生协调的音视频,并为语音生成实现强对齐。为系统评估我们的方法,我们引入了 Verse-Bench 新基准数据集。为推动音视频生成研究的发展并缩小与最新模型(如 Veo3)的性能差距,我们将 our 模型和代码公开于可访问平台。我们希望这一贡献能惠及更广泛的研究社区。项目页面:https://dorniwang.github.io/UniVerse-1/。

关键词

引用

@article{arxiv.2509.06155,
  title  = {UniVerse-1: Unified Audio-Video Generation via Stitching of Experts},
  author = {Duomin Wang and Wei Zuo and Aojie Li and Ling-Hao Chen and Xinyao Liao and Deyu Zhou and Zixin Yin and Xili Dai and Daxin Jiang and Gang Yu},
  journal= {arXiv preprint arXiv:2509.06155},
  year   = {2025}
}

备注

Project page: https://dorniwang.github.io/UniVerse-1/