SCORE: 用于改进内容表示的自监督对应微调
计算与语言
2024-03-12 v1 声音
音频与语音处理
摘要
对基于自监督学习 (SSL) 的语音模型进行高性价比的自监督微调 (SSFT) 以获取任务特定表示,正受到越来越多的关注。这些任务特定表示通过在有标签数据上进行微调,用于在各种下游任务中实现稳健的性能。本文提出了一种名为自监督对应 (SCORE) 微调的高性价比 SSFT 方法,以将 SSL 语音表示适配于内容相关任务。该方法采用对应训练策略,旨在从扰动语音和原始语音中学习相似的表示。通过应用内容相关任务 (ASR) 中常用的数据增强技术来获取扰动语音。在 SUPERB 基准上,经 SCORE 微调的 HuBERT 在单 GPU 上仅需数小时 (< 5 小时) 的微调,便在自动语音识别、音素识别和示例查询任务中优于原始 HuBERT,相对提升分别为 1.09%、3.58% 和 12.65%。与近期提出的 SSFT 方法 SPIN 相比,SCORE 仅使用 SPIN 所处理语音的 1/3,便取得了与之相当的结果。
引用
@article{arxiv.2403.06260,
title = {SCORE: Self-supervised Correspondence Fine-tuning for Improved Content Representations},
author = {Amit Meghanani and Thomas Hain},
journal= {arXiv preprint arXiv:2403.06260},
year = {2024}
}
备注
Accepted at ICASSP 2024