基于说话人不变聚类的自监督微调以改进内容表征
计算与语言
2023-05-19 v1 音频与语音处理
摘要
自监督语音表征模型已在各项任务中取得成功,但利用无标签数据改进其内容相关问题仍具挑战性。我们提出说话人不变聚类(Spin),一种新颖的自监督学习方法,其对语音表征进行聚类,并在原始语句与说话人扰动语句之间执行交换预测。Spin 仅需单块 GPU 上 45 分钟微调即可解耦说话人信息并保留内容表征。Spin 改进了预训练网络,并在语音识别与声学单元发现上优于先前方法。
引用
@article{arxiv.2305.11072,
title = {Self-supervised Fine-tuning for Improved Content Representations by Speaker-invariant Clustering},
author = {Heng-Jui Chang and Alexander H. Liu and James Glass},
journal= {arXiv preprint arXiv:2305.11072},
year = {2023}
}
备注
Accepted to Interspeech 2023