实时语音打断分析:从云端到客户端部署
计算与语言
2022-10-25 v1 人工智能
机器学习
摘要
会议是所有类型组织的一种基本沟通形式,自 COVID-19 大流行以来,远程协作系统已被更广泛地使用。远程会议的一个主要问题是远程参与者难以打断并发言。我们最近开发了首个语音打断分析模型,该模型检测失败的语音打断,表现出非常有前景的性能,并正在云端部署。为了以更具成本效益和环保的方式提供此功能,我们降低了模型复杂度和大小,将 WavLM_SI 模型部署到客户端设备中。在本文中,我们首先描述了如何通过在大数据集上训练并微调,将失败语音打断检测模型在 1% 假阳性率(FPR)下的真阳性率(TPR)从 50.9% 成功提升到 68.3%。然后我们将模型大小从 222.7 MB 缩减到 9.3 MB,精度损失在可接受范围内,并将复杂度从 31.2 GMACS(Giga Multiply-Accumulate Operations per Second)降低到 4.3 GMACS。我们还估算了复杂度降低的环境影响,这可作为基于大型 Transformer 模型的一般准则,从而使这些模型以更少的计算开销更易被使用。
引用
@article{arxiv.2210.13334,
title = {Real-time Speech Interruption Analysis: From Cloud to Client Deployment},
author = {Quchen Fu and Szu-Wei Fu and Yaran Fan and Yu Wu and Zhuo Chen and Jayant Gupchup and Ross Cutler},
journal= {arXiv preprint arXiv:2210.13334},
year = {2022}
}