中文

超越深度学习:基于神经编织的语音分割与电话分类

音频与语音处理 2026-03-19 v1 声音

摘要

深度学习主导语音处理,但依赖大规模数据集、全局反向传播引导的权重更新,产生 entangled 表示。Assembly Calculus(AC)通过Hebb规则和赢家竞争模型稀疏神经编织,提供生物学依据的替代方案,但 prior work 仅聚焦于离散符号输入。我们引入基于AC的语音处理框架,直接处理连续语音,结合三个关键贡献:(i) 神经编码将语音转换为 assembly 兼容的脉冲模式,采用概率 mel 二值化和 population-coded MFCC;(ii) 多区域架构在层次时间尺度和类别间组织编织;(iii) 跨区域更新机制用于下游任务。应用于边界检测和段落分类两个核心任务,框架在无任何权重训练情况下检测到电话(F1=0.69)和单词(F1=0.61)边界,实现47.5%和45.1%的电话和命令识别准确率。这些结果表明,AC基于动力学系统是语音处理中深度学习的可行替代方案。

关键词

引用

@article{arxiv.2603.16923,
  title  = {Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies},
  author = {Trevor Adelson and Vidhyasaharan Sethu and Ting Dang},
  journal= {arXiv preprint arXiv:2603.16923},
  year   = {2026}
}

备注

Submitted to Interspeech 2026. 9 Pages