中文

利用深度卷积神经网络改进语音特征检测的音频转图像编码

声音 2025-03-11 v1 人工智能 音频与语音处理

摘要

本文提出了一种新颖的音频转图像编码框架,该框架将语音特征的多维度信息整合为单张 RGB 图像,用于说话人识别。在该方法中,绿色通道编码原始音频数据,红色通道嵌入语音信号的统计描述符(包括基频、频谱质心、带宽、滚降点、过零率、MFCCs、RMS 能量、频谱平坦度、频谱对比度、色度和谐波噪声比等关键指标),蓝色通道包含以空间组织格式表示这些特征的子帧。在这些复合图像上训练的深度卷积神经网络在两名说话人的分类中达到了 98% 的准确率,表明这种集成的多通道表示能够为语音识别任务提供更具判别力的输入。

关键词

引用

@article{arxiv.2503.05929,
  title  = {Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks},
  author = {Youness Atif},
  journal= {arXiv preprint arXiv:2503.05929},
  year   = {2025}
}

备注

11 pages, 24 figures, 1 table, 3 algorithms. Submitted to F1000Research