无声说话:仅基于面部输入的多说话者静默语音合成
声音
2026-02-03 v1
摘要
本文提出一种新型框架,用于生成无需依赖任何可听输入的多说话者语音。我们的方法利用静默电位肌电信号(EMG)捕获语言内容,同时通过面部图像匹配目标说话者的声学身份。值得注意的是,我们提出了一种分离音高的内容嵌入,增强了从EMG信号中提取语言内容的能力。大量分析表明,我们的方法可以在不依赖任何可听输入的情况下生成多说话者语音,并确认了所提出分离音高方法的有效性。
引用
@article{arxiv.2602.01879,
title = {Speaking Without Sound: Multi-speaker Silent Speech Voicing with Facial Inputs Only},
author = {Jaejun Lee and Yoori Oh and Kyogu Lee},
journal= {arXiv preprint arXiv:2602.01879},
year = {2026}
}
备注
This paper was presented at ICASSP 2025