面向目标说话人提取的分层说话人表示
声音
2024-01-08 v3 音频与语音处理
摘要
目标说话人提取旨在根据注册语音(或称锚点)从多个声源复合体中分离出特定说话人的声音。当前方法主要从锚点提取说话人嵌入并整合进分离网络以分离目标说话人语音。然而,说话人嵌入的表示过于简单,往往仅为 1*1024 的向量。这种稠密信息使分离网络难以有效利用。为解决此局限,我们引入一种称为分层表示(HR)的新方法,将锚点数据在分离网络的细粒度与全局共 5 个层级上无缝融合,提升目标提取精度。HR 增强了锚点效能以改善目标说话人隔离。在 Libri-2talker 数据集上,HR 大幅优于 SOTA 时频域技术。进一步展示 HR 能力,我们在著名的 ICASSP 2023 深度噪声抑制挑战赛中夺得第一。所提 HR 方法通过增强锚点利用,在推进目标说话人提取方面展现出巨大潜力。
引用
@article{arxiv.2210.15849,
title = {Hierarchical speaker representation for target speaker extraction},
author = {Shulin He and Huaiwen Zhang and Wei Rao and Kanghao Zhang and Yukai Ju and Yang Yang and Xueliang Zhang},
journal= {arXiv preprint arXiv:2210.15849},
year = {2024}
}
备注
Accepted to ICASSP 2024