中文

上下文语音提取:利用文本历史作为目标语音提取的隐式线索

声音 2025-03-13 v1 机器学习 音频与语音处理

摘要

在本文中,我们研究了一种目标语音提取(TSE)的新方法,该方法仅依赖文本上下文来提取目标语音。我们将此任务称为上下文语音提取(CSE)。与依赖预录制注册语音、目标说话人面部视频、空间信息或其他显式线索来识别目标流的传统TSE方法不同,我们提出的方法仅需要少量先前对话(或独白)历史。这种方法在移动消息环境中自然可行,因为语音录音通常由可隐式利用的文本对话前置。我们提出了三种CSE模型并在三个数据集上分析了其性能。通过实验,我们证明即使模型仅依赖对话历史,也能仅通过两个先前对话回合以超过90%的准确率识别正确的目标流。此外,我们展示了通过在训练期间同时利用文本上下文和注册语音作为线索,可以进一步增强模型的灵活性和有效性,允许在推理时使用任一线索,或组合两者以获得更好的性能。样本和代码可在https://miraodasilva.github.io/cse-project-page获取。

关键词

引用

@article{arxiv.2503.08798,
  title  = {Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction},
  author = {Minsu Kim and Rodrigo Mira and Honglie Chen and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2503.08798},
  year   = {2025}
}

备注

Accepted to ICASSP 2025