语音自监督表示基准测试:更大探测头的必要性
音频与语音处理
2024-02-22 v2 机器学习
声音
信号处理
摘要
自监督学习(SSL)利用大规模无标注语音数据集,在减少标注数据量的同时达到令人印象深刻的性能。大量被提出的方法催生了综合基准,用于在探索语音信号各方面的下游任务集合上评估其性能。然而,尽管所考虑的任务数量不断增长,多数方案依赖单一的下游架构将冻结的SSL表示映射到任务标签。本研究考察了基准测试结果如何受探测头架构变化的影响。有趣的是,我们发现改变下游架构结构会导致所评估模型的性能排名显著波动。与语音SSL基准中的常见做法相反,我们评估了更大容量的探测头,展示了其对性能、推理成本、泛化及多层次特征利用的影响。
引用
@article{arxiv.2308.14456,
title = {Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads},
author = {Salah Zaiem and Youcef Kemiche and Titouan Parcollet and Slim Essid and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2308.14456},
year = {2024}
}
备注
18 Pages