在手机上训练端到端语音转文本模型
音频与语音处理
2021-12-08 v1 声音
摘要
在移动设备上训练最先进的语音转文本(STT)模型具有挑战性,因为相对于服务器环境其资源有限。此外,这些模型在通用数据集上训练,无法详尽捕捉用户特定特征。近来,设备端个性化技术在缓解该问题上取得进展。尽管许多现有工作已探索设备端个性化的有效性,但其发现多限于仿真设置或特定智能手机。本文中,我们开发并详细阐述了在手机上训练端到端模型的框架。为简洁起见,我们考虑了基于连接时序分类(CTC)损失的模型。我们在不同品牌的多种手机上评估了该框架并报告结果。我们充分证明,微调模型与选择正确超参数值,是在可达最低词错率(WER)、设备端训练时间与内存消耗之间的权衡。因此,这对于在手机等资源受限环境中成功部署设备端训练至关重要。我们使用来自不同口音说话人的训练集,记录了平均词错率(WER)下降 7.6%。我们还报告了手机端实时训练相关的时间、内存使用与 CPU 利用率等计算成本测量值。
引用
@article{arxiv.2112.03871,
title = {Training end-to-end speech-to-text models on mobile phones},
author = {Zitha S and Raghavendra Rao Suresh and Pooja Rao and T. V. Prabhakar},
journal= {arXiv preprint arXiv:2112.03871},
year = {2021}
}