中文

面向目标说话人语音处理的说话人表征探究

声音 2024-10-16 v1 计算与语言 音频与语音处理

摘要

目标说话人语音处理 (TS) 任务,如目标说话人自动语音识别 (TS-ASR)、目标语音提取 (TSE) 和个人语音活动检测 (p-VAD),对于从干扰说话人嘈杂的环境中提取特定说话人的信息具有重要意义。虽然大多数研究聚焦于每个特定任务的训练方案或系统架构,但针对嵌入目标说话人线索的辅助网络尚未在统一的跨任务评估中进行系统性调查。因此,本文旨在回答一个根本性问题:哪种说话人表征最适用于 TS 任务?为此,我们针对 TS-ASR、TSE 和 p-VAD 任务,比较了预训练的说话人编码器(即自监督或说话人识别模型),这些模型从预录制的目标说话人说话中计算说话人嵌入;以及从目标说话人身份以 one-hot 向量形式直接派生的理想说话人嵌入。进一步为了解理想说话人嵌入的属性,我们采用梯度基于的方法对其进行优化,以提升在 TS 任务上的性能。我们的分析结果表明,说话人验证性能与 TS 任务性能关系不大;one-hot 向量优于基于招聘的嵌入;且最优嵌入取决于输入混合信号。

关键词

引用

@article{arxiv.2410.11243,
  title  = {Investigation of Speaker Representation for Target-Speaker Speech Processing},
  author = {Takanori Ashihara and Takafumi Moriya and Shota Horiguchi and Junyi Peng and Tsubasa Ochiai and Marc Delcroix and Kohei Matsuura and Hiroshi Sato},
  journal= {arXiv preprint arXiv:2410.11243},
  year   = {2024}
}

备注

Accepted at IEEE SLT 2024