UniTalking:面向说话人肖像生成的统一音视频框架
计算机视觉与模式识别
2026-03-03 v1 多媒体
声音
摘要
虽然 Veo3 和 Sora2 等最新音视频生成模型展现出惊人的能力,但其闭源性质使得其架构和训练范式难以获取。为弥合此差距,本文引入 UniTalking,一个统一的、端到端的扩散框架,用于生成高保真的语音和同步的视频。其核心框架采用多模态 Transformer 块,通过共享的自注意力机制显式建模音频和视频潜在标记之间的细粒度时序对应关系。通过利用来自预训练视频生成模型的强大先验,本框架确保了最先进的视觉保真度,同时实现了高效训练。此外,UniTalking 集成了个人化语音克隆功能,允许从简短的音频参考生成目标风格的语音。定性和定量结果表明,本方法生成的说话人肖像高度逼真,在唇同步精度、音频自然性和整体感知质量方面均优于现有开源方法。
引用
@article{arxiv.2603.01418,
title = {UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation},
author = {Hebeizi Li and Zihao Liang and Benyuan Sun and Zihao Yin and Xiao Sha and Chenliang Wang and Yi Yang},
journal= {arXiv preprint arXiv:2603.01418},
year = {2026}
}
备注
Accepted at CVPR 2026 (Findings Track)