中文

Lip-Siri:基于 Wi-Fi 背散射的非接触式开放语句静默语音交互

人机交互 2026-01-27 v1

摘要

静默语音界面(SSI)可在对噪声敏感或对隐私敏感的环境中实现静默交互。然而,现有的 SSI 在隐私、用户体验和能耗之间存在实际部署的权衡,且大多数仍局限于对预定义的小规模词汇或句子进行闭集识别,这限制了现实世界中的表达能力。在本文中,我们提出了 Lip-Siri,据我们所知,这是首个基于 Wi-Fi 背散射的 SSI,它通过词典引导的子词解码支持开放词汇句子识别。Lip-Siri 设计了一种频移背散射标签,用于隔离标签调制的反射并抑制来自非目标运动的干扰,从而能够从无处不在的 Wi-Fi 信号中可靠地提取唇部运动轨迹。然后,我们将连续轨迹分割为唇部运动单元,对其进行聚类,通过基于聚类的自监督学习鲁棒的单元表示,最后提出了一种带集束搜索的词典引导 Transformer 编码器-解码器,用于解码变长句子序列。我们实现了一个端到端原型,并在多种场景下由 15 名参与者对 340 个句子和 3,398 个单词进行了评估。Lip-Siri 在单词预测上达到了 85.61% 的准确率,在连续句子识别上的词错率(WER)为 36.87%,接近具有代表性的基于视觉的唇读系统的性能。

关键词

引用

@article{arxiv.2601.18177,
  title  = {Lip-Siri: Contactless Open-Sentence Silent Speech with Wi-Fi Backscatter},
  author = {Ye Tian and Haohua Du and Chao Gu and Junyang Zhang and Shanyue Wang and Hao Zhou and Jiahui Hou and Xiang-Yang Li},
  journal= {arXiv preprint arXiv:2601.18177},
  year   = {2026}
}