TGIF:目标说话人提取的说话人群体信息预熟悉
音频与语音处理
2025-08-06 v1
摘要
最先进的目标说话人提取 (Target Speaker Extraction, TSE) 系统通常被设计为能够泛化到任何给定的混合环境,这要求模型具有足够大的容量以作为通用模型。个性化语音增强可以是一种适应单用户场景的专用解决方案,但它忽略了在仅涉及少数说话人的情况下进行定制的实际需求,例如针对特定家庭的 TSE。我们通过提出的概念——TSE 的说话人群体信息预熟悉 (Talker Group-Informed Familiarization, TGIF)——来填补这一空白,其中 TSE 系统专门针对特定的用户群体,但由于固有地缺乏干净语音目标,这颇具挑战性。为此,我们采用了知识蒸馏方法,其中特定群体的学生模型从大型教师模型生成的伪干净目标中学习。这使得学生模型能够在保持计算效率的同时,有效地从特定说话人群体中提取目标说话人。实验结果表明,我们的方法通过适应给定说话人群体的独特语音特征,优于基线通用模型。我们新提出的 TGIF 概念凸显了为多样化和真实世界应用开发专用解决方案的潜力,例如在家庭拥有的设备上进行端侧 TSE。
引用
@article{arxiv.2507.14044,
title = {TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction},
author = {Tsun-An Hsieh and Minje Kim},
journal= {arXiv preprint arXiv:2507.14044},
year = {2025}
}