语音基础模型未学习的内容是什么?
计算与语言
2024-10-18 v1 声音
音频与语音处理
摘要
理解语音基础模型如何捕捉非语言线索对于提高其可解释性和跨任务适应性至关重要。本文分析了包括 Whisper、Seamless、Wav2Vec、HuBERT 和 Qwen2-Audio 在内的几款知名模型,重点关注它们在 Dynamic-SUPERB 基准测试中进行的非语言和非语言任务的所学表示。我们的研究回答了三个关键问题:(1)捕捉了哪些非语言线索(例如说话者意图、情感、环境背景)?(2)这些线索在模型不同层中如何被表示?(3)这些表示在多大程度上可以有效地适应下游任务?为回答这些问题,我们首先以零样本设置评估这些模型,然后对从这些模型中提取的各层特征进行微调。我们的结果提供了关于模型泛化能力、其层级表示特征以及下游任务适应所需转换程度的见解。我们的发现表明,尽管这些模型未被明确训练用于这些任务,但在各种任务上表现良好。我们还观察到,零样本性能与更好地学习的表示呈正相关。对层级特征的分析表明,一些模型在表示的可分离性与模型深度之间呈凸关系,不同层捕捉任务特定特征。
引用
@article{arxiv.2410.12948,
title = {What Do Speech Foundation Models Not Learn About Speech?},
author = {Abdul Waheed and Hanin Atwany and Bhiksha Raj and Rita Singh},
journal= {arXiv preprint arXiv:2410.12948},
year = {2024}
}
备注
20 Pages