Seeing Voices:使用 Mirage 从音频生成 A-Roll 视频
计算机视觉与模式识别
2025-06-11 v1 人工智能
机器学习
摘要
从专业电影制作到用户生成内容,创作者和消费者早就认识到视频的力量取决于我们所听到的内容(视频的音轨)与我们所看到的内容(视频的图像序列)的和谐整合。当前的视频生成方法要么忽略声音以专注于通用但无声的图像序列生成,要么同时处理视觉和音频元素但专注于受限的应用领域(如重新配音)。我们引入了 Mirage,一种从音频到视频的基础模型,擅长在给定音频输入的情况下从零开始生成逼真、富有表现力的输出图像。当与现有的语音合成方法(text-to-speech,或 TTS)集成时,Mirage 生成了引人入胜的多模态视频。当在人们说话的音视频素材(A-roll)上训练并以包含语音的音频为条件时,Mirage 生成的人物视频能够对输入音频中隐含的表演进行令人信服的诠释。我们的核心技术贡献是一种训练基于自注意力的音频到视频生成模型的统一方法,可以从零开始训练或在给定现有权重的基础上进行训练。这种方法论使 Mirage 作为音频到视频生成的方法保持了通用性,同时其输出的主观质量优于结合了特定于人的音频特定架构或损失组件,或特定于图像或音频捕获细节的方法。我们鼓励读者亲自观看和收听 Mirage 的结果(参见论文和评论以获取链接)。
引用
@article{arxiv.2506.08279,
title = {Seeing Voices: Generating A-Roll Video from Audio with Mirage},
author = {Aditi Sundararaman and Amogh Adishesha and Andrew Jaegle and Dan Bigioi and Hyoung-Kyu Song and Jon Kyl and Justin Mao and Kevin Lan and Mojtaba Komeili and ShahRukh Athar and Sheila Babayan and Stanislau Beliasau and William Buchwalter},
journal= {arXiv preprint arXiv:2506.08279},
year = {2025}
}
备注
Technical report website: mirage.app/research/seeing-voices, product website: mirage.app