面向副语言任务的基于集成学习的端到端特征选择
音频与语音处理
2022-10-31 v1 声音
摘要
近年来的事件凸显了远程医疗解决方案的重要性,其有可能实现远程治疗与诊断。与此相关,计算副语言学作为语音处理的一个独特子领域,旨在提取关于说话人的信息,并构成远程医疗应用的重要部分。在本工作中,我们关注两个副语言问题:口罩检测与呼吸状态预测。为这些任务开发的解决方案可能极具价值,并有望帮助监测和限制如COVID-19此类病毒的传播。当前针对这些任务提出的最先进方法是基于深度神经网络(如ResNets)结合特征工程的集成方法。尽管这些集成方法能达到高准确率,但它们也具有较大的占用空间并需要大量计算能力,降低了向资源受限设备的可移植性。这些缺陷也意味着先前提出的解决方案因其规模与速度而无法用于远程医疗系统。另一方面,采用较轻量的特征工程系统可能费力且增加进一步复杂性,难以快速建立可部署系统。本工作提出一种基于集成学习的自动特征选择方法,以实现快速且内存高效的系统开发。具体而言,我们提出一种基于输出梯度的方法,在使用大型、性能良好的集成模型发现关键特征后,再训练较小的模型。在我们的实验中,观察到基于输出梯度特征的神经网络集成推理时间显著减少(25–32%)。我们的方法提供了一种简单途径来提升系统速度并实现实时使用,同时在与使用全部谱特征的大占用空间集成相比时保持有竞争力的结果。
引用
@article{arxiv.2210.15978,
title = {End-to-end Ensemble-based Feature Selection for Paralinguistics Tasks},
author = {Tamás Grósz and Mittul Singh and Sudarsana Reddy Kadiri and Hemant Kathania and Mikko Kurimo},
journal= {arXiv preprint arXiv:2210.15978},
year = {2022}
}