基于阻性纳米线网络的能源高效音频分类:无预处理的低延迟储备计算
声音
2025-10-28 v2 无序系统与神经网络
音频与语音处理
应用物理
统计计算
摘要
高效的音频特征提取对于低延迟、资源受限的语音识别至关重要。传统的预处理技术,如梅尔频谱图(Mel Spectrogram)、感知线性预测(Perceptual Linear Prediction, PLP)和可学习频谱图(Learnable Spectrogram),虽然实现了高分类准确率,但需要大量特征集和显著计算资源。神经形态计算的低延迟和低功耗优势为音频分类提供了强大的潜力。本文引入阻性纳米线网络作为语音数字分类的神经形态硬件预处理层,首次实现了此功能。纳米线网络直接从原始音频中提取紧凑且信息丰富的特征,在准确率、数据压缩率(相对于原始音频大小)和训练时间效率之间实现了良好的平衡。与最先进的软件技术相比,纳米线特征在XGBoost下达到98.95%的准确率,实现66倍的数据压缩;在Random Forest下达到97.9%的准确率,实现255倍的压缩,训练延迟在亚秒内。对于多种分类器,纳米线特征始终实现超过90%的准确率,数据压缩率超过62.5倍,显著优于基于MFCC等传统最先进技术提取的特征,在效率上实现了性能提升而不牺牲性能。此外,纳米线特征在分类多说话人音频时达到96.5%的准确率,超越了所有最先进特征技术的最高准确率,同时实现了最高的数据压缩率和最低的训练时间。纳米线网络的预处理还提高了音频数据的线性可分性,改善了简单分类器的性能,并在说话人之间实现了良好的泛化。这些结果表明,阻性纳米线网络提供了一种新型的、低延迟且数据高效的特征提取方法,使其能够实现高性能的神经形态音频分类。
引用
@article{arxiv.2411.19611,
title = {Memristive Nanowire Network for Energy Efficient Audio Classification: Pre-Processing-Free Reservoir Computing with Reduced Latency},
author = {Akshaya Rajesh and Pavithra Ananthasubramanian and Nagarajan Raghavan and Ankush Kumar},
journal= {arXiv preprint arXiv:2411.19611},
year = {2025}
}
备注
14 pages, 5 Figures