PHONOS:用于在线流媒体应用的语音中性化
音频与语音处理
2026-03-31 v1 计算与语言
机器学习
摘要
说话人匿名化 (SA) 系统修改语音音色,同时保留区域性或非母语口音,这会导致匿名集合受限。为解决此问题,我们提出 PHONOS,这是一个用于实时 SA 的流式模块,可中性化非母语口音,使其听起来像母语化。我们的方法预生成保存源语音音色和节奏,但使用静默感知 DTW 对齐并进行零样本语音转换,将外来音位替换为母语音位。这些 utterance 监督一个因果语音翻译器,将非母语内容标记映射到母语等价物,最多仅需 40ms 的前瞻延迟,采用联合交叉熵和 CTC 损失进行训练。我们的评估显示,非母语口音置信度降低 81%,听众测试评级与此变化一致,语音链接性降低,因为中性化后的 utterance 在嵌入空间中远离原始说话人,同时在单 GPU 上延迟低于 241 ms。
引用
@article{arxiv.2603.27001,
title = {PHONOS: PHOnetic Neutralization for Online Streaming Applications},
author = {Waris Quamer and Mu-Ruei Tseng and Ghady Nasrallah and Ricardo Gutierrez-Osuna},
journal= {arXiv preprint arXiv:2603.27001},
year = {2026}
}
备注
The paper is submitted to Interspeech 2026 and currently under review