中文

提示驱动的特定语音分段

音频与语音处理 2024-01-09 v3 信号处理

摘要

我们引入一项称为“特定语音分段(target speech diarization)”的新任务,旨在确定音频信号中“目标事件何时发生”。我们设计了一种称为提示驱动特定语音分段(PTSD)的神经架构,可处理指定感兴趣目标语音事件的多样化提示。我们使用源自 Librispeech 的 sim2spk、sim3spk 与 sim4spk 数据集对 PTSD 进行训练与评估。我们表明所提框架能准确局部化目标语音事件。此外,我们的框架通过其在三项分段相关任务上的出色表现展现出通用性:目标说话人语音活动检测、重叠语音检测与性别分段。特别地,PTSD 在真实与仿真数据上于这些任务中取得了与专用模型相当的性能。本工作可作为参考基准,并为提示驱动特定语音处理提供有价值的见解。

关键词

引用

@article{arxiv.2310.14823,
  title  = {Prompt-driven Target Speech Diarization},
  author = {Yidi Jiang and Zhengyang Chen and Ruijie Tao and Liqun Deng and Yanmin Qian and Haizhou Li},
  journal= {arXiv preprint arXiv:2310.14823},
  year   = {2024}
}

备注

Accepted by ICASSP 2024