基于大语言模型的静默语音交互的跨模态方法
人机交互
2024-03-12 v1 人工智能
声音
音频与语音处理
摘要
静默语音接口(SSI)为无声语言交流提供了一种非侵入性的脑机接口替代方案。我们引入了多模态口部神经音频系统(MONA),通过 novel loss函数——跨对比(crossCon)和监督时间对比(supTcon)——实现跨模态对齐,以训练具有共享潜在表示的多模态模型。该架构使我们能够利用像 LibriSpeech 这样的仅语音数据集来提高静默语音识别效果。此外,我们提出的大语言模型集成评分调整(LISA)显著提高了识别准确率。 MONA LISA 在开放词汇表的 Gaddy(2020)基准数据集上,将状态最佳的词错误率(WER)从 28.8% 降至 12.2%。对于副电位肌肉(vocal EMG)记录,其方法将状态最佳性能从 23.3% 提升至 3.7%。在 Brain-to-Text 2024 竞赛中,LISA 表现最佳,将最高 WER 从 9.8% 提升至 8.9%。在我们所知的最佳案例中,本工作代表了第一个在开放词汇表上实现非侵入式静默语音识别且将错误率降至 15% 以下的实例,表明 SSI 可为自动语音识别(ASR)提供可行的替代方案。我们的工作不仅缩小了静默语音与发声语音之间的性能差距,也为人机交互开辟了新的可能性,展示了在噪声和数据受限环境下跨模态方法的潜力。
引用
@article{arxiv.2403.05583,
title = {A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition},
author = {Tyler Benster and Guy Wilson and Reshef Elisha and Francis R Willett and Shaul Druckmann},
journal= {arXiv preprint arXiv:2403.05583},
year = {2024}
}