用于语音识别的主动学习:梯度的力量
计算与语言
2016-12-13 v1 机器学习
机器学习
摘要
在训练语音识别系统时,标记音频片段的成本可能很高,且并非所有数据都具有同等价值。主动学习旨在仅标记信息量最大的样本以降低成本。对于语音识别,置信度分数和其他基于似然的主动学习方法已被证明是有效的。然而,基于梯度的主动学习方法仍不为人所充分理解。本工作研究了端到端语音识别主动学习中的 Expected Gradient Length (EGL) 方法。我们从方差缩减的角度对 EGL 进行了论证,并观察到 EGL 对信息量的度量会选择与置信度分数不相关的新颖样本。实验表明,与随机采样相比,EGL 可以将词错误率降低 11%,或者将需要标记的样本数量减少 50%。
引用
@article{arxiv.1612.03226,
title = {Active Learning for Speech Recognition: the Power of Gradients},
author = {Jiaji Huang and Rewon Child and Vinay Rao and Hairong Liu and Sanjeev Satheesh and Adam Coates},
journal= {arXiv preprint arXiv:1612.03226},
year = {2016}
}
备注
published as a workshop paper at NIPS 2016