中文

Face2VoiceSync: 面向文本驱动说话人脸生成的轻量级人脸-语音一致性方法

声音 2025-07-28 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

近期在语音驱动说话人脸生成方面的研究取得了有前景的结果,但它们对固定驱动语音的依赖限制了进一步的应用(例如,人脸-语音不匹配)。因此,我们将任务扩展到一个更具挑战性的场景:给定一张人脸图像和要说的文本,同时生成说话人脸动画及其对应的语音。相应地,我们提出了一个新颖的框架 Face2VoiceSync,具有若干创新贡献:1) 语音-人脸对齐,确保生成的语音与人脸外观匹配;2) 多样性与操控,能够在副语言特征空间上控制生成的语音;3) 高效训练,使用轻量级 VAE 桥接视觉和音频大型预训练模型,其可训练参数远少于现有方法;4) 新的评估指标,公平地评估多样性和身份一致性。实验表明,Face2VoiceSync 在单个 40GB GPU 上实现了视觉和音频方面的最先进性能。

关键词

引用

@article{arxiv.2507.19225,
  title  = {Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation},
  author = {Fang Kang and Yin Cao and Haoyu Chen},
  journal= {arXiv preprint arXiv:2507.19225},
  year   = {2025}
}