残差标记增强基于掩码自编码器的语音建模
声音
2026-01-28 v1 人工智能
摘要
近期语音建模依赖显式属性,如基频、内容和说话人身份,但这些属性单独来看无法捕捉自然语音的全部丰富性。我们引入 RT-MAE,一种新型掩码自编码框架,通过引入无监督残差可训练标记来增强受监督属性驱动的建模,这些标记旨在编码由显式标记因子(如音色变化、噪声、情感等)无法解释的信息。实验表明,RT-MAE 在重建质量方面具有改进,能够保持内容和说话人相似性,同时增强表达性。我们进一步演示其在语音增强中的应用,通过推断时去除噪声,同时保持可控性和自然性。
引用
@article{arxiv.2601.19399,
title = {Residual Tokens Enhance Masked Autoencoders for Speech Modeling},
author = {Samir Sadok and Stéphane Lathuilière and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:2601.19399},
year = {2026}
}
备注
Submitted to ICASSP 2026 (accepted)