中文

TOLD:一种用于说话人日志化的新颖两阶段重叠感知框架

声音 2023-12-14 v2 人工智能 音频与语音处理

摘要

近来,端到端神经日志化(EEND)被提出并在说话人重叠场景中取得令人瞩目的结果。在EEND中,说话人日志化被表述为多标签预测问题,其中说话人活动被独立估计,其依赖关系未得到充分考虑。为克服这些缺陷,我们采用幂集编码将说话人日志化重构为单标签分类问题,并提出重叠感知EEND(EEND-OLA)模型,其中说话人重叠与依赖可被显式建模。受两阶段混合系统成功的启发,我们进一步提出一种新颖的两阶段重叠感知日志化框架(TOLD),引入说话人重叠感知后处理(SOAP)模型来迭代精化EEND-OLA的日志化结果。实验结果表明,与原始EEND相比,所提EEND-OLA在日志化错误率(DER)上取得14.39%的相对提升,而使用SOAP带来额外19.33%的相对提升。因此,我们的方法TOLD在CALLHOME数据集上取得10.14%的DER,据我们所知这是该基准上的新SOTA结果。

关键词

引用

@article{arxiv.2303.05397,
  title  = {TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization},
  author = {Jiaming Wang and Zhihao Du and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2303.05397},
  year   = {2023}
}

备注

Accepted by ICASSP2023