中文

基于跨尺度与多层级表示学习的移动录音设备识别

声音 2024-11-07 v1 音频与语音处理

摘要

本文提出了一种采用多层级全局处理的建模方法,涵盖短期帧级和长期样本级两种特征尺度。在浅层特征提取的初始阶段,采用多种尺度提取多层级特征,包括梅尔频率倒谱系数(MFCC)和预 Fbank 对数能量谱。识别网络模型的构建考虑了来自帧级和样本级两个层面的二维时序特征。具体而言,模型首先采用基于一维卷积的卷积长短期记忆网络(ConvLSTM)来融合时空信息并提取短期帧级特征。随后,利用双向长短期记忆网络(BiLSTM)学习长期样本级序列表示。Transformer 编码器随后对全局帧级和样本级特征进行跨尺度、多层级处理,促进两个层级的深度特征表示与融合。最后通过 Softmax 获得识别结果。本方法在 CCNU_Mobile 数据集上取得了令人瞩目的 99.6% 识别准确率,相比基线系统有 2% 至 12% 的显著提升。此外,我们全面考察了模型的迁移能力,在新数据集上的分类任务中取得了 87.9% 的准确率。

关键词

引用

@article{arxiv.2411.03668,
  title  = {Mobile Recording Device Recognition Based Cross-Scale and Multi-Level Representation Learning},
  author = {Chunyan Zeng and Yuhao Zhao and Zhifeng Wang},
  journal= {arXiv preprint arXiv:2411.03668},
  year   = {2024}
}

备注

16 pages