同时训练还是顺序训练?语音表征在多任务自监督学习系统中的协作方式
音频与语音处理
2024-03-08 v1 机器学习
摘要
采用自监督算法的语音表征学习在许多下游任务中带来了显著的性能提升。近期工作将自监督学习(SSL)与视觉接地语音(VGS)处理机制结合用于表征学习。SSL 与 VGS 机制的联合训练提供了基于数据可用性利用无标注语音与语音相关视觉信息的机会,这被证明可提升所学表征的质量,尤其在编码语义与词汇层面知识方面。在本工作中,我们进一步将基于 wav2vec 2.0 的 SSL 与基于 transformer 的 VGS 作为多任务学习系统研究其联合优化。我们探索一组训练场景以理解语音表征如何在两任务间共享或迁移,以及对于跨模态语义检索与音素辨别性能的最优训练策略为何。结果显示,先 wav2vec 2.0 后 VGS 的顺序训练相比两学习机制同时优化在音视频检索上提供更高性能。然而,并行 SSL-VGS 训练在切换优化准则时减轻了灾难性遗忘的影响。此外,结果表明通过 VGS 机制习得的音素表征相比 SSL 习得的更易跨数据集泛化。
引用
@article{arxiv.2306.02972,
title = {Simultaneous or Sequential Training? How Speech Representations Cooperate in a Multi-Task Self-Supervised Learning System},
author = {Khazar Khorrami and María Andrea Cruz Blandón and Tuomas Virtanen and Okko Räsänen},
journal= {arXiv preprint arXiv:2306.02972},
year = {2024}
}
备注
5 pages, accepted by EUSIPCO 2023