基于音视频自蒸馏预训练和说话人适配的目标说话人口语化
音频与语音处理
2025-02-11 v1
摘要
口语化是一种重要技术,用于在嘈杂环境中促进人机交互。我们先前开发的自监督学习方法 AV2vec 利用多模态自蒸馏,在说话人独立的英语 LRS3 数据集上展现了有前景的性能。然而,AV2vec 面临训练成本高、以及针对除英语之外的其他语言(如中文)口语化数据稀缺等挑战。此外,大多数研究集中于说话人独立的口语化模型,这些模型难以考虑不同说话人风格之间的显著差异。为此,我们提出了全面的方法。首先,我们研究跨语言迁移学习,适配从源语言预训练的 AV2vec 模型以优化目标语言中的口语化任务。其次,我们通过说话人适配策略提升针对特定目标说话人的口语化准确性,这在以往研究中鲜见。最后,基于分析口语化与口部区域感兴趣区域(ROI)和面部输入的互补性能,我们引入模型集成策略,将二者整合,显著提升模型性能。我们的方法在 ChatCLR 数据集评估集上的字符错误率(CER)为 77.3%,低于 2024 年 Chat 场景中文口语化挑战赛的顶尖结果。
引用
@article{arxiv.2502.05758,
title = {Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation},
author = {Jing-Xuan Zhang and Tingzhi Mao and Longjiang Guo and Jin Li and Lichen Zhang},
journal= {arXiv preprint arXiv:2502.05758},
year = {2025}
}
备注
accepted to ESWA journal