自监督语音表征学习中用于 pretext task 选择的conditional independence
音频与语音处理
2021-10-14 v2 机器学习
声音
信号处理
摘要
通过求解 pretext task,自监督学习(SSL)利用无标签数据提取有用的潜在表征,以替代下游任务中的传统输入特征。一种常见的 pretext task 包括在与原始信号导出的伪标签上预训练 SSL 模型。该技术在语音数据中尤为相关,因为各种有意义的信号处理特征可作为伪标签。然而,为语音或其他类型数据选择伪标签的过程仍大多未被探索,目前依赖于观察最终下游任务上的结果。尽管如此,由于巨大的计算(进而碳)成本,该方法在规模上不可持续。因此,本文引入一个实用且理论的框架,针对给定下游任务选择相关伪标签。更确切地说,我们提出一个基于条件独立理论、无需任何训练的伪标签效用函数估计器。在说话人识别与自动语音识别上进行的实验验证了我们的估计器,显示出下游任务观测性能与我们的方法所得效用估计之间的显著相关性,从而便利了自监督语音表征学习相关伪标签的探查。
引用
@article{arxiv.2104.07388,
title = {Conditional independence for pretext task selection in Self-supervised speech representation learning},
author = {Salah Zaiem and Titouan Parcollet and Slim Essid},
journal= {arXiv preprint arXiv:2104.07388},
year = {2021}
}
备注
5 pages, Accepted for presentation at Interspeech2021