中文

器件内语音识别

音频与语音处理 2025-09-23 v2 声音

摘要

随着去中心化计算的兴起,如物联网、自动驾驶和个性化医疗等领域,越来越需要在边缘端高效地处理时序信号——即在数据采集的地方进行处理,避免与集中计算设施(或云端)进行耗时、不安全且成本高昂的通信。然而,现代处理器由于固有的架构限制(von Neumann 瓶颈)或领域转换(模拟到数字、时间到频率),往往难以满足边缘系统受限的功耗和时间预算。本文提出了一种基于两种器件内计算系统的边缘时序信号处理器,用于特征提取和分类,在TI-46-Word语音识别任务中实现了96.2%的软件级准确率。首先,一种非线性、室温掺杂网络处理器(DNPU)层实现了来自原始音频信号的模拟、时域特征提取,类似于人类共鸣器。其次,一种模拟内存计算(AIMC)芯片由由 memistor 交叉阵列组成,实现了一个在提取特征后用于分类的紧凑神经网络。DNPU特征提取耗能为100s nW,基于AIMC的分类在每次乘-累加运算中仅需不到10 fJ的能耗。我们的发现为通过器件内计算硬件发展边缘异构智能处理器的紧凑性、效率和性能提供了可前景的途径。

关键词

引用

@article{arxiv.2410.10434,
  title  = {In-Materia Speech Recognition},
  author = {Mohamadreza Zolfagharinejad and Julian Büchel and Lorenzo Cassola and Sachin Kinge and Ghazi Sarwat Syed and Abu Sebastian and Wilfred G. van der Wiel},
  journal= {arXiv preprint arXiv:2410.10434},
  year   = {2025}
}