比较基于语音模式中 sEMG 编码精度:语音语音学和音素特征
声音
2026-04-28 v2 计算与语言
摘要
我们测试了 Speech Articulatory Coding(SPARC)特征是否能线性预测 aloud、mimed 和 subvocal 语音模式下表面电肌电图(sEMG)包络。采用句子级交叉验证的弹性网套件多变量时序响应函数(mTRF),SPARC 在几乎所有电极和所有语音模式下的预测准确率均高于音素 one-hot 表征。aloud 与 mimed 语音表现相当,subvocal 语音仍保持在显著水平以上,表明可检测到语音语音学活动。方差分解显示,SPARC 贡献显著,音素特征贡献最小。mTRF 权重模式揭示了电极部位与语音语音学运动之间的可解读关系,这些关系在不同语音模式下保持一致。本研究聚焦于表征/编码分析(非端到端解码),支持 SPARC 作为 sEMG 无声语音建模中稳健且可解释的中间目标。
引用
@article{arxiv.2604.18920,
title = {Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features},
author = {Chenqian Le and Ruisi Li and Beatrice Fumagalli and Yasamin Esmaeili and Xupeng Chen and Amirhossein Khalilian-Gourtani and Tianyu He and Adeen Flinker and Yao Wang},
journal= {arXiv preprint arXiv:2604.18920},
year = {2026}
}