以 token 级训练损失增强基于 Transformer-Transducer 的说话人变化检测
音频与语音处理
2022-12-06 v2 机器学习
声音
摘要
在本工作中,我们提出一种新颖的基于 token 的训练策略,可改善基于 Transformer-Transducer (T-T) 的说话人变化检测 (SCD) 性能。常规的 T-T 基于 SCD 模型损失对所有输出 token 同等优化。由于训练数据中说话人变化的稀疏性,常规的 T-T 基于 SCD 模型损失导致次优的检测精度。为缓解此问题,我们使用定制的编辑距离算法在训练期间估计 token 级 SCD 错误接受 (FA) 与错误拒绝 (FR) 率,并优化模型参数以最小化 FA 与 FR 的加权组合,使模型聚焦于准确预测说话人变化。我们还提出一组更契合商业用例的评估度量。在一组具有挑战性的真实世界数据集上的实验表明,所提训练方法可在相同参数量下显著提升 SCD 模型的整体性能。
引用
@article{arxiv.2211.06482,
title = {Augmenting Transformer-Transducer Based Speaker Change Detection With Token-Level Training Loss},
author = {Guanlong Zhao and Quan Wang and Han Lu and Yiling Huang and Ignacio Lopez Moreno},
journal= {arXiv preprint arXiv:2211.06482},
year = {2022}
}