中文

WESPER:基于耳语的语音交互中零样本实时耳语转正常语音转换

声音 2023-03-06 v1 人机交互 音频与语音处理

摘要

识别耳语语音并将其转换为正常语音为语音交互创造了许多可能性。由于耳语语音的声压显著低于正常语音,它可用作公共场所中不被他人听见的半静音语音交互。将耳语转换为正常语音也改善了言语或听力障碍者的语音质量。然而,传统语音转换技术无法提供充分的转换质量,或需要由耳语和正常语音成对语句组成的说话人相关数据集。为解决这些问题,我们提出WESPER,一种基于自监督学习的零样本、实时耳语转正常语音转换机制。WESPER由语音到单元(STU)编码器(生成耳语和正常语音共有的隐藏语音单元)和单元到语音(UTS)解码器(从编码语音单元重建语音)组成。与现有方法不同,该转换与用户无关,且不需要耳语和正常语音的成对数据集。UTS解码器可从语音单元以任意目标说话人声音重建语音,且仅需未标记的目标说话人语音数据。我们确认从耳语转换的语音质量得到提升,同时保留其自然韵律。此外,我们确认了所提方法对言语或听力障碍者进行语音重建的有效性。(项目页:http://lab.rekimoto.org/projects/wesper )

关键词

引用

@article{arxiv.2303.01639,
  title  = {WESPER: Zero-shot and Realtime Whisper to Normal Voice Conversion for Whisper-based Speech Interactions},
  author = {Jun Rekimoto},
  journal= {arXiv preprint arXiv:2303.01639},
  year   = {2023}
}

备注

ACM CHI 2023 paper