中文

pTSE-T:使用未对齐文本线索的演示目标说话人提取

声音 2026-04-28 v3 多媒体 音频与语音处理

摘要

目标说话人提取(TSE)旨在从音频混合中提取目标说话人的清晰语音,消除无关的背景噪声和语音。虽然先前工作探索了各种辅助线索,包括预录语音、视觉信息和空间信息,但在许多实际场景中获取和选择此类强线索是不可行的。与此不同,本文将TSE算法建立在从有限且未对齐的文本内容(如演示幻灯片的浓缩要点)中提取的语义线索之上。该方法在会议、海报展示或讲座演示等场景中特别有用,在这些场景中实时获取其他线索可能具有挑战性。为此,我们设计了两种不同的网络。具体而言,我们提出的文本提示提取网络(TPE)将音频特征与基于内容的语义线索融合,以促进时频掩码生成,从而滤除多余噪声。实验结果表明,利用来自有限且未对齐文本的语义线索准确提取目标说话人语音的有效性,实现了12.16 dB的SI-SDRi、12.66 dB的SDRi、0.830的PESQi和0.150的STOIi。

关键词

引用

@article{arxiv.2411.03109,
  title  = {pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues},
  author = {Ziyang Jiang and Jiahe Lei and Xueyan Chen and Yifan Zhang and Zexu Pan and Wei Xue and Xinyuan Qian},
  journal= {arXiv preprint arXiv:2411.03109},
  year   = {2026}
}