通过声道运动学编码语音
音频与语音处理
2025-03-04 v4 人工智能
计算与语言
声音
摘要
声道发音是语音产生的一个自然的、有根基的控制空间。发音器官的时空协调与声源相结合,形成清晰的语音,从而实现有效的口语交流。基于语音的这种生理基础,我们提出了一种新的语音神经编解码框架——语音发音编码(SPARC)。SPARC包含一个从语音音频推断发音特征的发音分析模型,以及一个从发音特征合成语音音频的发音合成模型。发音特征是声道发音器和声源特征的运动轨迹,它们直观可解释且可控,是语音产生的实际物理接口。一个额外的说话人身份编码器与发音合成器联合训练,以告知个体说话人的声音纹理。通过在大规模语音数据上进行训练,我们实现了一个完全清晰、高质量的发音合成器,该合成器能够泛化到未见过的说话人。此外,说话人嵌入与发音有效解耦,从而实现了保留口音的零样本语音转换。据我们所知,这是首次展示通用、高性能的发音推断与合成,表明所提出的框架是一个强大的语音编码系统。
引用
@article{arxiv.2406.12998,
title = {Coding Speech through Vocal Tract Kinematics},
author = {Cheol Jun Cho and Peter Wu and Tejas S. Prabhune and Dhruv Agarwal and Gopala K. Anumanchipalli},
journal= {arXiv preprint arXiv:2406.12998},
year = {2025}
}