基于神经亲和度分数融合的多尺度说话人日志
音频与语音处理
2020-11-23 v1
摘要
识别人类对话中短片段的说话人身份一直被认为是语音信号处理中最具挑战性的问题之一。短语音片段的说话人表征往往不可靠,导致在需要说话人识别的任务中说话人表征保真度差。在本文中,我们提出了一种非常规方法,以应对时间分辨率与说话人表征质量之间的权衡。为寻找一组平衡多个时间尺度片段分数的权重,提出了一种神经亲和度分数融合模型。使用 CALLHOME 数据集,我们展示了所提出的多尺度分割与集成方法能够实现最先进的日志性能。
引用
@article{arxiv.2011.10527,
title = {Multi-Scale Speaker Diarization With Neural Affinity Score Fusion},
author = {Tae Jin Park and Manoj Kumar and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2011.10527},
year = {2020}
}
备注
Submitted to ICASSP 2021