LLM 能理解无声语音吗?基于 LLM 的 EMG 到文本转换探索
计算与语言
2025-06-03 v1
摘要
无声肌电图(EMG)是无法产生发声言语的个体的有效交流工具。然而,大多数先前的方法依赖于配对的发声与无声 EMG 信号以及语音数据进行 EMG 到文本的转换,这对于这些个体而言并不实用。鉴于大语言模型(LLM)在语音识别领域的兴起,我们探索其理解无声语音的潜力。为此,我们应对了仅从无声 EMG 中学习的挑战,并提出了一种新颖的 EMG 适配器模块,该模块将 EMG 特征映射到 LLM 的输入空间,在闭集词汇无声 EMG 到文本任务上实现了 0.49 的平均词错误率(WER)。即使仅有六分钟的保守数据可用量,我们的方法也比专用模型性能提升了近 20%。尽管 LLM 已被证明可扩展至新的语言模态(如音频),但理解诸如无声 EMG 等发音生物信号仍更具挑战性。本工作迈出了使 LLM 利用表面 EMG 理解无声语音的关键第一步。
引用
@article{arxiv.2506.00304,
title = {Can LLMs Understand Unvoiced Speech? Exploring EMG-to-Text Conversion with LLMs},
author = {Payal Mohapatra and Akash Pandey and Xiaoyuan Zhang and Qi Zhu},
journal= {arXiv preprint arXiv:2506.00304},
year = {2025}
}
备注
Accepted to ACL 2025 main conference