EH-MAM:用于自监督语音表示学习的易到难掩码声学建模
声音
2024-10-18 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
本文提出了 EH-MAM(Easy-to-Hard 自适应掩码声学建模),这是一种用于语音表示学习的新型自监督学习方法。与先前使用随机掩码方案进行掩码声学建模(MAM)的方法不同,我们引入了一种新颖的选择性和自适应掩码策略。具体而言,在 SSL 训练期间,我们逐步向模型引入更难的区域进行重建。我们的 approach 自动选择困难区域,基于以下观察:MAM中各帧的重建损失可提供自然信号,用于判断该帧解决MAM预文本任务的难度。为识别这些困难区域,我们采用教师模型,首先预测帧级损失,然后决定要掩码的帧。通过学习创建具有挑战性的问题(例如识别更难的帧并同时解决它们),模型能够学习更有效的表示,从而获得对语音的更全面的理解。定量地,EH-MAM 在各种低资源语音识别和 SUPERB 基准测试中均优于多个最新基线,提升幅度为 5%至 10%。此外,我们进行了详尽分析,表明EH-MAM掩码的区域有效地捕获了语音帧之间的有用上下文。
引用
@article{arxiv.2410.13179,
title = {EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning},
author = {Ashish Seth and Ramaneswaran Selvakumar and S Sakshi and Sonal Kumar and Sreyan Ghosh and Dinesh Manocha},
journal= {arXiv preprint arXiv:2410.13179},
year = {2024}
}