中文

增强时空表示学习的语音录音源手机识别

声音 2022-08-29 v1 人工智能 音频与语音处理

摘要

现有源手机识别方法缺乏对源设备的长期特征刻画,导致源手机相关特征表示不准确,从而造成识别精度不足。在本文中,我们提出一种基于时空表示学习的源手机识别方法,其包括两个主要部分:序列高斯均值矩阵特征提取与基于时空表示学习的识别模型构建。在特征提取部分,基于录音源信号的时间序列表示分析,我们利用高斯混合模型对数据分布的敏感性提取具有长期与短期表示能力的序列高斯均值矩阵。在模型构建部分,我们设计结构化时空表示学习网络 C3D-BiLSTM 以充分刻画时空信息,结合 3D 卷积网络与双向长短期记忆网络进行短期频谱信息与长时间波动信息表示学习,并通过融合录音源信号的时空特征信息实现手机准确识别。该方法在 CCNU_Mobile 数据集上对 45 部手机的闭集识别达到 99.03% 的平均准确率,在小样本实验中达 98.18%,识别性能优于现有最先进方法。实验结果表明,该方法在多类手机识别中展现出优异的识别性能。

关键词

引用

@article{arxiv.2208.12753,
  title  = {Spatio-Temporal Representation Learning Enhanced Source Cell-phone Recognition from Speech Recordings},
  author = {Chunyan Zeng and Shixiong Feng and Zhifeng Wang and Xiangkui Wan and Yunfan Chen and Nan Zhao},
  journal= {arXiv preprint arXiv:2208.12753},
  year   = {2022}
}

备注

29 pages, 4 figures