中文

用于学习说话人识别与移动健康中节能表示的掩蔽核

音频与语音处理 2023-08-16 v2 声音

摘要

现代智能手机具备音频采集硬件,并可执行说话人识别与健康评估等语音处理任务。然而,能耗仍然是一个问题,尤其是对于资源密集型的 DNN。先前的工作通过采用紧凑模型或降低语音特征维度来提升 DNN 的能效。这两种方法都降低了 DNN 推理期间的能耗,但未降低语音采集期间的能耗。本文提出在 DNN 训练期间将掩蔽核集成到梯度下降中,以学习用于加窗(样本构建的常见步骤)的最节能语音长度与采样率。为确定最节能最优参数,将具有非零导数的掩蔽函数与低通滤波器结合。所提方法将数据采集与推理的能耗均降低 57%,并且在说话人识别与创伤性脑损伤检测基线中具有竞争力。

关键词

引用

@article{arxiv.2302.04161,
  title  = {Masking Kernel for Learning Energy-Efficient Representations for Speaker Recognition and Mobile Health},
  author = {Apiwat Ditthapron and Emmanuel O. Agu and Adam C. Lammert},
  journal= {arXiv preprint arXiv:2302.04161},
  year   = {2023}
}