面向隐私监管的语音到语音翻译系统的预设语音匹配
计算与语言
2024-07-19 v1 密码学与安全
机器学习
声音
音频与语音处理
摘要
近年来,行业环境下语音到语音翻译(S2ST)系统的需求日益增长。虽然已成功商业化,但基于克隆的S2ST系统在被不当使用时会暴露给分销商责任,并在被媒体组织滥用时侵犯人格权。本工作提出了一个受监管的S2ST框架,称为预设语音匹配(PVM)。PVM通过首先将输入语音匹配到目标语言中类似的先前授意语音来消除S2ST中的跨语言语音克隆。通过这种分离,PVM避免了对输入说话者进行克隆,确保PVM系统符合监管要求并降低滥用风险。我们的结果表明,PVM在多说话者环境下显著提高了S2ST系统的运行时性能和S2ST合成语音的自然性。就我们所知,PVM是首个利用类似匹配的预设语音实现受监管的S2ST框架。
引用
@article{arxiv.2407.13153,
title = {Preset-Voice Matching for Privacy Regulated Speech-to-Speech Translation Systems},
author = {Daniel Platnick and Bishoy Abdelnour and Eamon Earl and Rahul Kumar and Zahra Rezaei and Thomas Tsangaris and Faraj Lagum},
journal= {arXiv preprint arXiv:2407.13153},
year = {2024}
}
备注
Accepted to the ACL PrivateNLP 2024 Workshop, 7 pages, 2 figures