中文

OmniSonic:面向通用全方位音频生成

声音 2026-04-07 v1 计算机视觉与模式识别 多媒体

摘要

本文提出了通用全方位音频生成(UniHAGen)任务,用于合成包含多样化领域中旁屏外及屏幕内声音的综合听觉场景(例如环境事件、乐器和人类语音)。先前的视频条件音频生成模型通常专注于生成对应可见发声事件的屏幕内环境声,忽略了屏幕外听觉事件。虽然最近的全方位联合文本-视频到音频生成模型旨在生成包含屏幕内外声音的听觉场景,但仅限于非语音声音,缺乏生成或集成人类语音的能力。为克服这些限制,我们引入 OmniSonic,一个基于流匹配的扩散框架,联合以视频和文本为条件。它采用 TriAttn-DiT 架构,通过三个交叉注意力操作分别处理屏幕内环境声、屏幕外环境声和语音条件,配合 Mixture-of-Experts (MoE) 门控机制在生成期间自适应平衡其贡献。此外,我们构建了 UniHAGen-Bench,包含超过一千个样本,覆盖三个典型的屏幕内/屏幕外语音-环境情景。广泛实验表明,OmniSonic 在客观指标和人类评估方面 consistently 优于最新方法,为通用全方位音频生成树立了强基准。项目页面:https://weiguopian.github.io/OmniSonic_webpage/

关键词

引用

@article{arxiv.2604.04348,
  title  = {OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text},
  author = {Weiguo Pian and Saksham Singh Kushwaha and Zhimin Chen and Shijian Deng and Kai Wang and Yunhui Guo and Yapeng Tian},
  journal= {arXiv preprint arXiv:2604.04348},
  year   = {2026}
}

备注

CVPR 2026