中文

用于噪声环境下音频签名分析的 LSTM-CNN 网络

声音 2024-07-23 v1 人工智能 人机交互 音频与语音处理

摘要

在工作、展览、商场、销售和工业应用中,自动统计人数并识别其性别有多种应用。尽管当前的语音检测方法在大多数情况下应该运行良好,但除了性别之外,当前说话人的数量通常是未知的,并且由于可能存在的类别过多,分类方法并不适用。在本研究中,我们专注于长短期记忆卷积神经网络(LSTM-CNN),以提取声音数据中依赖于时间和/或频率的特征,从而估计噪声环境中每一帧同时活跃说话人的数量/性别。考虑到说话人的最大数量为 10,我们利用了 19000 个音频样本进行学习,这些样本包含了公共城市、工业场景、商场、展览、工作场所和自然环境中男性、女性和背景噪声的多种组合。这一概念验证表明了良好的性能,在检测数量和性别时的训练/验证 MSE 值约为 0.019/0.017。

关键词

引用

@article{arxiv.2312.07059,
  title  = {LSTM-CNN Network for Audio Signature Analysis in Noisy Environments},
  author = {Praveen Damacharla and Hamid Rajabalipanah and Mohammad Hosein Fakheri},
  journal= {arXiv preprint arXiv:2312.07059},
  year   = {2024}
}

备注

10th Annual Conf. on Computational Science & Computational Intelligence (CSCI'23)