连续目标语音提取:增强复杂录音中的个性化说话人分离与提取
声音
2024-01-30 v1 音频与语音处理
摘要
目标说话人提取(TSE)旨在从输入混合语音中提取目标说话人的声音。以往研究主要关注高重叠场景。然而,现实应用通常面临更复杂的场景,如变化的说话人重叠和目标说话人缺失。本文引入一个执行连续 TSE(C-TSE)的框架,该框架包含一个目标说话人语音活动检测(TSVAD)模型和一个 TSE 模型。该框架显著提升了在相似说话人上的 TSE 性能,并增强了传统说话人分离方法所缺乏的个性化能力。具体而言,与用于细化分离结果的传统 TSVAD 不同,所提出的注意力目标说话人语音活动检测(A-TSVAD)直接生成目标说话人的时间戳。我们还通过比较级联和并行方法,探索了 A-TSVAD 与 TSE 的不同集成方式。该框架的有效性通过一系列指标进行评估,包括说话人分离和语音增强指标。我们的实验表明,A-TSVAD 在减少说话人分离错误方面优于传统方法。此外,以顺序级联方式集成 A-TSVAD 和 TSE 进一步提高了提取精度。
引用
@article{arxiv.2401.15993,
title = {Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings},
author = {He Zhao and Hangting Chen and Jianwei Yu and Yuehai Wang},
journal= {arXiv preprint arXiv:2401.15993},
year = {2024}
}
备注
8 pages, 6 figures