中文

交叉注意力即所需:用于个性化语音增强的实时流式 Transformer

音频与语音处理 2022-11-09 v1 声音

摘要

个性化语音增强 (Personalised Speech Enhancement, PSE) 仅从录制的音频片段中提取目标用户的语音并去除其他所有内容,这可以潜在地改善部署在野外的音频 AI 模块的用户体验。为了支持各种下游音频任务,如实时自动语音识别 (Automatic Speech Recognition, ASR) 和音频通话增强,PSE 解决方案应以流式模式运行,即输入音频的清理应实时进行,且具有低延迟和低实时因子。个性化通常通过从注册音频中提取目标说话人的声纹(以静态嵌入向量的形式),然后用其调节 PSE 模型的输出来实现。然而,固定的目标说话人嵌入可能并非在所有条件下都是最优的。在这项工作中,我们提出了一个基于流式 Transformer 的 PSE 模型,并提出了一种新颖的交叉注意力方法,该方法能提供自适应的目标说话人表示。我们进行了广泛的实验,结果表明,即使我们的模型大小仅为基线模型的大约一半,我们提出的交叉注意力方法也始终优于竞争基线。

关键词

引用

@article{arxiv.2211.04346,
  title  = {Cross-Attention is all you need: Real-Time Streaming Transformers for Personalised Speech Enhancement},
  author = {Shucong Zhang and Malcolm Chadwick and Alberto Gil C. P. Ramos and Sourav Bhattacharya},
  journal= {arXiv preprint arXiv:2211.04346},
  year   = {2022}
}