大语言时代下的静默语音界面:全面分类学与系统综述
音频与语音处理
2026-03-13 v1
摘要
人机交互传统上依赖声学信道,这种依赖在环境噪声、隐私限制和生理语音损伤方面引入系统性漏洞。静默语音界面(Silent Speech Interfaces, SSIs)作为一种变革性范式,能够通过解码来自神经-肌肉-关节连续体的语言意图,直接绕过声学阶段。本综述提供了 SSI 领域的高层次综合,引导从传统以 transducer 为中心的分析转向意图到执行的整体分类学。我们系统评估了四个关键生理拦截点的感知模态:神经振荡、神经肌肉激活、关节运动学(超声/磁力计)以及通过声学或射频感知的普遍主动探测。关键地,我们分析了从基于启发式信号处理向潜在语义对齐(Latent Semantic Alignment)范式的转变。在新时代,大语言模型(LLMs)和深度生成架构作为高层语言先验,用于解决生物信号的“信息稀疏性”和非平稳性。通过将碎片化生理手势映射到结构化语义潜在空间,现代 SSI 框架首次接近了实用部署所需的 Word Error Rate 阈值。我们进一步检讨了 SSI 从笨重实验室仪器向“不可见界面”集成到商品级可穿戴设备(如 earable 和智能眼镜)的转变。最后,我们在自监督基础模型和“神经安全”伦理边界方面,为解决“用户依赖悖论”制定了战略路线图,以保护日益交互化世界中的认知自由。
引用
@article{arxiv.2603.11877,
title = {Silent Speech Interfaces in the Era of Large Language Models: A Comprehensive Taxonomy and Systematic Review},
author = {Kele Xu and Yifan Wang and Ming Feng and Qisheng Xu and Wuyang Chen and Yutao Dou and Cheng Yang and Huaimin Wang},
journal= {arXiv preprint arXiv:2603.11877},
year = {2026}
}
备注
20 pages, 4 figures