中文

SottoVoce:基于超声成像与深度神经网络的静音语音交互

人机交互 2023-03-06 v1 机器学习 声音 音频与语音处理 图像与视频处理

摘要

由语音操控的数字设备正迅速普及。然而,语音界面的应用仍受限制。例如,在公共场所说话会打扰周围人,且秘密信息不应出声。环境噪声可能降低语音识别准确率。为应对这些局限,本文提出一种检测用户无声发音的系统。通过附着于下颌下方的超声成像传感器观测内部信息,我们所提系统可在用户不出声的情况下识别发音内容。我们提出的深度神经网络模型用于从超声图像序列中获取声学特征。我们确认由本系统生成的音频信号可控制现有智能音箱。我们还观察到用户可调整其口腔动作以学习并提升其语音识别准确率。

关键词

引用

@article{arxiv.2303.01758,
  title  = {SottoVoce: An Ultrasound Imaging-Based Silent Speech Interaction Using Deep Neural Networks},
  author = {Naoki Kimura and Michinari Kono and Jun Rekimoto},
  journal= {arXiv preprint arXiv:2303.01758},
  year   = {2023}
}

备注

ACM CHI 2019 paper