中文

面向端到端语音理解的深度 F 值最大化

音频与语音处理 2020-08-11 v1 计算与语言 机器学习 声音

摘要

口语语言理解(SLU)数据集与许多其他机器学习数据集一样,通常受标签不平衡问题困扰。标签不平衡常导致所学模型在输出中复制类似偏差,从而引发对数据集中少数类不公平的问题。本文中,我们通过最大化 F 值而非准确率来应对公平性问题。我们提出 F 值的可微近似,并借助标准反向传播以该目标训练网络。我们在两个标准公平性数据集 Adult 和 Communities and Crime,以及 ATIS 数据集上的语音到意图检测、Speech-COCO 数据集上的语音到图像概念分类上开展实验。在这四项任务中,与采用交叉熵损失函数训练的模型相比,F 值最大化均提升了微平均 F1 分数,绝对提升最高达 8%。在两个多类 SLU 任务中,所提方法显著改善了类覆盖度,即具有正召回率的类别数量。

关键词

引用

@article{arxiv.2008.03425,
  title  = {Deep F-measure Maximization for End-to-End Speech Understanding},
  author = {Leda Sarı and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2008.03425},
  year   = {2020}
}

备注

Interspeech 2020 submission (Accepted)