通过不变性与冗余约简理解语音表征的自监督学习
声音
2024-01-25 v2 机器学习
音频与语音处理
摘要
自监督学习(SSL)已成为从未标记数据中学习灵活语音表征的一种有前景的范式。通过设计利用统计规律性的代理任务,SSL 模型可以捕获可迁移到下游任务的有用表征。本研究对 Barlow Twins(BT)进行了实证分析,BT 是一种受人类感知中冗余约简理论启发的 SSL 技术。在下游任务上,BT 表征加速了学习并实现了跨域迁移。然而,在解耦关键解释因子方面存在局限,仅靠冗余约简和不变性不足以将学习到的隐变量分解为模块化、紧凑且信息丰富的编码。我们的消融研究分离了来自不变性约束的收益,但这些收益是依赖于上下文的。总体而言,本工作证实了 Barlow Twins 用于样本高效语音编码的潜力。然而,在实现完全分层表征方面仍存在挑战。该分析方法与见解为结合进一步归纳先验和感知原则以进一步增强 BT 自监督框架的扩展铺平了道路。
引用
@article{arxiv.2309.03619,
title = {Understanding Self-Supervised Learning of Speech Representation via Invariance and Redundancy Reduction},
author = {Yusuf Brima and Ulf Krumnack and Simone Pika and Gunther Heidemann},
journal= {arXiv preprint arXiv:2309.03619},
year = {2024}
}
备注
13 pages, 5 figures, in submission to MDPI Information