中文

面向跨种群神经基座模型的端到端语音解码

计算与语言 2026-05-15 v5 人工智能

摘要

语音脑机接口(BCI)旨在通过将神经活动翻译为文本来恢复瘫痪患者的交流能力。现有大多数系统采用级联式框架,先解码音素再通过n-gram语言模型拼接句子,无法同时优化所有阶段。本文引入端到端BraIn-to-Text(BIT)框架,通过单一可微神经网络将神经活动直接翻译为连贯句子。核心在于跨任务、跨种群预训练神经编码器,其表征可迁移至尝试语音和想象语音。在级联式n-gram LM setting下,预训练编码器在Brain-to-Text'24和'25基准测试中建立了新SOTA。集成端到端的音频大语言模型(LLM)并采用对比学习进行跨模态对齐训练,BIT将先前端到端方法的词错误率(WER)从24.69%降至10.22%。值得注意的是,我们发现小规模音频LLM显著提升端到端解码效果。除实现创纪录的性能外,BIT还将尝试语音和想象语音嵌入对齐,支持跨任务泛化。总体而言,我们的方法推动了大规模异构神经数据集的整合,为支持无缝、可微优化的端到端解码框架铺平了道路。

关键词

引用

@article{arxiv.2511.21740,
  title  = {A cross-species neural foundation model for end-to-end speech decoding},
  author = {Yizi Zhang and Linyang He and Chaofei Fan and Tingkai Liu and Han Yu and Trung Le and Jingyuan Li and Scott Linderman and Lea Duncker and Francis R Willett and Nima Mesgarani and Liam Paninski},
  journal= {arXiv preprint arXiv:2511.21740},
  year   = {2026}
}