中文

面向目标说话人的人声学自蒸馊与说话人适配的唇读

声音 2025-02-11 v1 音频与语音处理 信号处理

摘要

唇读是实现噪声环境下人机交互的重要技术。我们先前开发的自监督学习方法 AV2vec 利用多模态自蒸馊,在说话人无关的英语 LRS3 数据集上展现出前景的性能。然而,AV2vec 面临高训练成本和针对除英语之外的其他语言(如中文)的人声学唇读数据稀缺的潏在问题。此外,大多数研究集中于说话人无关的唇读模型,这些模型难以考虑不同说话人风格的显著差异。为此,我们提出了一套全面的方法。首先,我们研究跨语言迁移学习,适配从源语言预训练的 AV2vec 模型,以优化目标语言中的唇读任务。其次,我们通过说话人适应策略提升针对特定目标说话人的唇读准确率,这在以往研究中鲜有探索。最后,在分析唇读区域 (ROI) 和面部输入的互补性能后,我们引入一种模型集成策略,将两者整合,显著提升了模型性能。我们的方法在 ChatCLR 数据集评估集上实现了 77.3% 的字符错误率 (CER),低于 2024 年 Chat 场景中文唇读挑战赛的领先结果。

关键词

引用

@article{arxiv.2502.05757,
  title  = {Large Language Model-based Nonnegative Matrix Factorization For Cardiorespiratory Sound Separation},
  author = {Yasaman Torabi and Shahram Shirani and James P. Reilly},
  journal= {arXiv preprint arXiv:2502.05757},
  year   = {2025}
}