中文

See the Speaker:利用先验指导和区域细化从语音生成高分辨率说话人面部图像

音频与语音处理 2026-03-03 v1 人工智能 计算机视觉与模式识别 声音

摘要

不同于依赖源图像作为外观参考并使用源语音生成运动的现有方法,本 work 提出了一种新方法,直接从语音中提取信息,以解决语音到说话人面部的关键挑战。具体而言,我们首先采用语音到面部肖像生成阶段,利用语音条件扩散模型结合统计面部先验和 sample-adaptive 加权模块,实现高质量的肖像生成。在随后的语音驱动说话人面部生成阶段,我们将唇部动作、面部表情和眼部动作等表达性动态嵌入扩散模型的潜在空间,并进一步利用区域增强模块优化唇部同步。为生成高分辨率输出,我们集成了预训练的基于 Transformer 的离散码本和图像渲染网络,以端到端方式增强视频帧的细节。实验结果表明,我们的方法在 HDTF、VoxCeleb 和 AVSpeech 数据集上优于现有方法。值得注意的是,这是首个仅凭单个语音输入即可生成高分辨率、高质量说话人面部视频的方法。

关键词

引用

@article{arxiv.2510.26819,
  title  = {See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement},
  author = {Jinting Wang and Jun Wang and Hei Victor Cheng and Li Liu},
  journal= {arXiv preprint arXiv:2510.26819},
  year   = {2026}
}

备注

16 pages,15 figures, accepted by TASLP