中文

PTS-SNN:一种用于高效语音情感识别的提示调优时移脉冲神经网络

人工智能 2026-02-10 v1 声音

摘要

语音情感识别(SER)广泛应用于人机交互,但传统模型的高计算成本阻碍了其在资源受限的边缘设备上的部署。脉冲神经网络(SNN)因其事件驱动特性提供了一种节能的替代方案;然而,它们与连续自监督学习(SSL)表示的集成从根本上受到分布不匹配的挑战,其中高动态范围嵌入会降低阈值神经元的编码能力。为解决此问题,我们提出了提示调优脉冲神经网络(PTS-SNN),一种参数高效的神经形态适配框架,它将冻结的SSL骨干与脉冲动力学对齐。具体来说,我们引入了一个时移脉冲编码器,通过无参数通道移位来捕捉局部时间依赖性,建立稳定的特征基础。为弥合领域差距,我们设计了一种上下文感知的膜电位校准策略。该机制利用脉冲稀疏线性注意力模块将全局语义上下文聚合到可学习的软提示中,这些提示动态调节参数化漏积分点火(PLIF)神经元的偏置电压。这种调节有效地将异质输入分布居中于响应点火范围内,减轻了功能沉默或饱和。在五个多语言数据集(例如IEMOCAP, CASIA, EMODB)上的大量实验表明,PTS-SNN在IEMOCAP上达到了73.34%的准确率,与有竞争力的人工神经网络(ANN)相当,同时每个样本仅需1.19M可训练参数和0.35 mJ的推理能量。

关键词

引用

@article{arxiv.2602.08240,
  title  = {PTS-SNN: A Prompt-Tuned Temporal Shift Spiking Neural Networks for Efficient Speech Emotion Recognition},
  author = {Xun Su and Huamin Wang and Qi Zhang},
  journal= {arXiv preprint arXiv:2602.08240},
  year   = {2026}
}