MobileASR:一种面向手机端用户语音个性化应用的资源感知设备端学习框架
音频与语音处理
2023-11-13 v2 人工智能
摘要
我们描述了一种综合方法,通过在手机上高效训练模型来开发用户语音个性化的自动语音识别(ASR)模型,使用户数据和模型能够本地存储与使用。为此,我们提出了一种考虑手机 RAM 与电池能力的资源感知基于子模型的训练方法。通过考量手机的评价指标与资源约束,我们能够实现高效训练并相应中止过程。为模拟真实用户,我们使用了带有各种口音的说话人。随后,该完整的设备端训练与评估框架在多个品牌的各类手机上进行了测试。我们表明,对模型进行微调并选择合适的超参数值,是在最低可达性能指标、设备端训练时间与内存消耗之间的权衡。总体而言,我们的方法在利用手机能力的同时,为开发个性化 ASR 模型提供了综合解决方案,并平衡了准确性需求与资源约束。
引用
@article{arxiv.2306.09384,
title = {MobileASR: A resource-aware on-device learning framework for user voice personalization applications on mobile phones},
author = {Zitha Sasindran and Harsha Yelchuri and Pooja Rao and T. V. Prabhakar},
journal= {arXiv preprint arXiv:2306.09384},
year = {2023}
}
备注
Accepted in AIMLSystems 2023