中文

WeSep:面向通用目标说话人提取的可扩展且灵活的工具包

音频与语音处理 2024-09-25 v1 声音

摘要

目标说话人提取(TSE)旨在从重叠的多说话人语音中隔离特定的目标说话人的语音,这是「酒会问题」中的典型场景。近年来,由于其在用户定制界面、助听器等各种应用场景的潜力,以及作为后续任务(如语音识别和说话人识别)关键的前端处理技术,TSE正受到日益关注的注意。然而,目前几乎没有可供开箱使用的开源工具包或可用的预训练模型。本文介绍了WeSep,一个用于TSE研究和实际应用的工具包。weSep特点包括灵活的目标说话人建模、可扩展的数据管理、有效的即时数据仿真、结构化的配方以及部署支持。该工具包已公开可用于\url{https://github.com/wenet-e2e/WeSep.}

关键词

引用

@article{arxiv.2409.15799,
  title  = {WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction},
  author = {Shuai Wang and Ke Zhang and Shaoxiong Lin and Junjie Li and Xuefei Wang and Meng Ge and Jianwei Yu and Yanmin Qian and Haizhou Li},
  journal= {arXiv preprint arXiv:2409.15799},
  year   = {2024}
}

备注

Interspeech 2024