用于人脸到语音合成的渐进式面部粒度聚合与双边属性增强
声音
2025-11-11 v3
摘要
对于经历过中风等创伤性事件的个体而言,语音可能不再是可行的交流方式。尽管文本到语音 (TTS) 可用作生成合成语音的交流辅助工具,但它无法保留用户本人的声音。因此,从面部图像推导出对应语音的面对面语音 (FTV) 合成提供了一种有前景的替代方案。然而,现有方法依赖预训练的视觉编码器,并对其进行微调以与语音嵌入对齐,这剥离了面部输入中的细粒度信息(如性别或种族),尽管这些信息已知与声音特征相关。此外,这些流程是多阶段的,需要分别训练多个组件,从而导致训练效率低下。为解决这些局限性,我们利用细粒度面部属性建模,将面部图像分解为不重叠的片段,并渐进式地将它们整合为多粒度表示。该表示通过在视觉和声学域对说话人属性(如性别和种族)进行多任务学习得到进一步优化。此外,为提高对齐鲁棒性,我们采用多视角训练策略,将说话人在不同角度和光照条件下的各种视觉视角与相同的语音录音配对。广泛的主客观评估证实,我们的方法显著增强了面部-语音一致性与合成稳定性。
引用
@article{arxiv.2509.07376,
title = {Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech Synthesis},
author = {Yejin Jeon and Youngjae Kim and Jihyun Lee and Hyounghun Kim and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2509.07376},
year = {2025}
}
备注
EMNLP Findings