无监督跨任务语音表征在“真实”边缘应用中的性能探索
音频与语音处理
2023-05-10 v1 声音
摘要
无监督语音模型在语音和机器学习社区中正变得无处不在。上游模型负责从原始音频中学习有意义的表征。随后,这些表征作为下游模型的输入以解决若干任务,例如关键词 spotting 或情感识别。随着边缘语音应用开始涌现,衡量这些跨任务表征在资源有限且噪声水平各异的边缘设备上的鲁棒性十分重要。为此,在本研究中我们评估了四种不同版本 HuBERT 的鲁棒性,即:base、large 和 extra-large 版本,以及近期称为 Robust-HuBERT 的版本。测试在三种下游任务(关键词 spotting、意图分类和情感识别)的不同加性和卷积噪声条件下进行。我们的结果表明,虽然更大的模型可对环境因子提供某些重要鲁棒性,但它们可能不适用于边缘应用。另一方面,较小的模型在噪声条件下表现出显著的准确率下降,尤其在房间混响存在时。这些发现表明跨任务语音表征尚未准备好用于边缘应用,仍需要创新。
引用
@article{arxiv.2305.05443,
title = {An Exploration into the Performance of Unsupervised Cross-Task Speech Representations for "In the Wild'' Edge Applications},
author = {Heitor Guimarães and Arthur Pimentel and Anderson Avila and Mehdi Rezagholizadeh and Tiago H. Falk},
journal= {arXiv preprint arXiv:2305.05443},
year = {2023}
}
备注
Extended Abstract accepted in the Edge Intelligence Workshop (EIW) 2022