中文

SpikeVox:基于脉冲驱动生成式语言模型的能效语音疗法框架

声音 2026-01-21 v1 人工智能 神经与进化计算

摘要

语言障碍会显著影响患者的交流、学习和社交能力。然而,现有的语音疗法解决方案(如治疗师或工具)仍有限且成本高昂,因而不足以服务全球数百万患者。为此,领先的方法采用神经网络算法帮助准确检测语言障碍。然而,这些方法不提供治疗建议,仅为患者提供部分解决方案。此外,这些方法因其复杂且资源密集的神经网络处理,导致高能耗,阻碍其在低功耗/能耗平台(如智能手机)上的部署。针对此,本文提出 SpikeVox,通过脉冲驱动生成式语言模型实现能效语音疗法解决方案。具体而言,SpikeVox 采用语音识别模块进行高精度语音转文本转换;利用脉冲驱动生成式语言模型高效进行语音障碍检测和治疗方案生成;提供正确发音指导作为反馈;并利用 REST API 实现用户无缝交互。实验结果表明,SpikeVox 在语音障碍识别中平均达到 88% 的置信水平,同时为治疗练习提供完整反馈。因此,SpikeVox 为能效语音疗法解决方案提供了综合框架,潜在地有望弥补全球显著的语音疗法获取差距。

关键词

引用

@article{arxiv.2510.15566,
  title  = {SpikeVox: Towards Energy-Efficient Speech Therapy Framework with Spike-driven Generative Language Models},
  author = {Rachmad Vidya Wicaksana Putra and Aadithyan Rajesh Nair and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2510.15566},
  year   = {2026}
}

备注

Accepted at the IEEE Biomedical Circuits and Systems Conference (BioCAS) 2025, Abu Dhabi, UAE