用于解耦话语级语音表征的自监督神经因子分析
声音
2023-10-05 v3 计算与语言
机器学习
音频与语音处理
摘要
自监督学习(SSL)语音模型如 wav2vec 和 HuBERT 在自动语音识别(ASR)上展现了最先进的性能,并证明在低标注资源场景下极为有用。然而,SSL 模型的成功尚未迁移到话语级任务,如说话人、情感和语言识别,这些任务仍需要对 SSL 模型进行有监督微调以获得良好性能。我们认为该问题源于缺乏针对这些任务的解耦表征与话语级学习目标。受 HuBERT 利用聚类发现隐藏声学单元的启发,我们构建了一个因子分析(FA)模型,该模型使用发现的隐藏声学单元来对齐 SSL 特征。底层话语级表征通过对齐特征上的概率推断从语音内容中解耦出来。此外,从 FA 模型导出的变分下界提供了话语级目标,允许误差梯度反向传播到 Transformer 层以学习高度判别性的声学单元。当与 HuBERT 的掩码预测训练结合使用时,我们的模型在 SUPERB 基准上仅用 20% 标注数据即在所有话语级非语义任务上优于当前最佳模型 WavLM。
引用
@article{arxiv.2305.08099,
title = {Self-supervised Neural Factor Analysis for Disentangling Utterance-level Speech Representations},
author = {Weiwei Lin and Chenhang He and Man-Wai Mak and Youzhi Tu},
journal= {arXiv preprint arXiv:2305.08099},
year = {2023}
}
备注
accepted by ICML 2023