中文

Lend a Hand:基于MLLM驱动的半训练-free 语音识别

音频与语音处理 2025-03-31 v1 声音

摘要

语音编码(Cued Speech,CS)是一种创新的视觉通信系统,将口唇读音与手势编码集成,旨在增强听力障碍者的有效沟通。自动CS识别(ACSR)指自动识别CS中手势和口唇运动,将其转换为文本的AI驱动过程。然而,先前工作常依赖复杂的融合模块和训练技术。此外,由于CS数据的限制,手部特征提取和识别建模一直表现不佳,显著限制了ACSR的有效性。为此,我们创新性地探索了多模态大语言模型(MLLM)在识别CS中手势形状和位置方面的能力。更准确地说,我们提出一种新的半训练-free范式用于ACSR,称为STF-ACSR。该方法利用中文CS提示模块(CCSPM)实现对手势运动的零样本识别,CCSPM基于MLLM进行关键帧过滤和定制化提示工程。随后,我们通过最小化融合模块(MFM)将识别结果整合到口唇阅读模型中,有效实现了优异的识别效果。Furthermore, 为本研究特别录制了8位有听力障碍的CS使用者的数据,补充现有6名正常听力CS使用者的数据,形成新的混合数据集。大量实验表明,STF-ACSR在正常听力和有听力障碍数据上均显著优于先前方法。实现代码和模型 checkpoints已公开:https://github.com/DennisHgj/STF_ACSR。

关键词

引用

@article{arxiv.2503.21785,
  title  = {Lend a Hand: Semi Training-Free Cued Speech Recognition via MLLM-Driven Hand Modeling for Barrier-free Communication},
  author = {Guanjie Huang and Danny Hin Kwok Tsang and Li Liu},
  journal= {arXiv preprint arXiv:2503.21785},
  year   = {2025}
}