LASE:面向印度语言的语言对抗说话人编码以实现跨脚本身份保持
摘要
用于多语言语音克隆的说话人编码器应在语音以不同脚本呈现时对同一说话人进行相同处理。商用编码器并非如此,错误呈现为方言相关。在 1043 对西方口音的语音语料库中覆盖英语、印地语、泰卢固语和泰米尔语,WavLM-base-plus-sv 在相同说话人更换脚本时损失 0.082 的绝对余弦相似度,ECAPA-TDNN 损失 0.105。在 1369 对印度口音的语料库中,差距缩小至 0.006(WavLM-SV)和 0.044(ECAPA-TDNN)。这种泄漏在跨脚本 TTS 最关乜的场景——将非印度语言训练的语音投影到印度脚本时——最为明显。我们提出了 LASE(Language-Adversarial Speaker Encoding,语言对抗说话人编码),在冻结的 WavLM-base-plus 上添加一个小型投影头,通过两个损失函数训练:一个是针对说话人身份的监督对比损失,另一个是针对 4 语言分类器的梯度反转交叉熵损失,后者推动嵌入在保持说话人信息的同时变得不具语言信息。我们在 1118 对质量筛选的跨脚本对语料库上进行训练(来自 8 个商业多语言语音),LASE 的残余差距在两个语料库上均接近零(西方 Delta = 0.013,印度 Delta = 0.026;bootstrap 95% 置信区间均包含零),并将跨脚本与基准之间的差距放大 2.4-2.7 倍。ECAPA+GRL 的消融实验表明,GRL 目标对任一主干网络都有所改善,但 WavLM 的选择也贡献了。合成多说话人说话人分割中,LASE 在跨脚本说话人召回率上与 ECAPA-TDNN 相当(0.788 vs 0.789),但所需训练数据约为其 1/100。我们发布 r1 检查点、两个语料库以及 bootstrap 配方。
引用
@article{arxiv.2605.00777,
title = {LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation},
author = {Venkata Pushpak Teja Menta},
journal= {arXiv preprint arXiv:2605.00777},
year = {2026}
}
备注
7 pages, 2 figures, 2 tables. Code, model, and datasets at https://github.com/praxelhq/lase