中文

探索用于说话人日志的强嵌入提取器

声音 2022-10-27 v1 人工智能 音频与语音处理

摘要

说话人嵌入提取器将输入音频映射到说话人判别性潜在空间,在说话人日志中至关重要。然而,在将嵌入提取器应用于日志任务时存在若干挑战,我们着重解决其中两个关键问题。首先,评估并非易事,因为说话人确认与日志任务获得更优性能所需的特征有所不同。我们表明,在广泛采用的说话人确认评估协议上取得更好性能,并不能带来更好的日志性能。其次,嵌入提取器未曾见过包含多个说话人的话语。由于语音重叠和说话人切换,这类输入在说话人日志中不可避免地存在,并会导致性能下降。为缓解第一个问题,我们生成了能更好模拟日志场景的说话人确认评估协议。我们提出两种数据增强技术以缓解第二个问题,使嵌入提取器能够感知语音重叠或说话人切换输入。一种技术生成语音重叠片段,另一种生成两个说话人顺序发声的片段。使用三种最先进的说话人嵌入提取器进行的大量实验结果表明,所提出的两种方法均有效。

关键词

引用

@article{arxiv.2210.14682,
  title  = {In search of strong embedding extractors for speaker diarisation},
  author = {Jee-weon Jung and Hee-Soo Heo and Bong-Jin Lee and Jaesung Huh and Andrew Brown and Youngki Kwon and Shinji Watanabe and Joon Son Chung},
  journal= {arXiv preprint arXiv:2210.14682},
  year   = {2022}
}

备注

5pages, 1 figure, 2 tables, submitted to ICASSP