SpeechGLUE:自监督语音模型能多好地捕获语言知识?
计算与语言
2024-08-28 v2 声音
音频与语音处理
摘要
用于语音表征的自监督学习(SSL)已成功应用于各类下游任务,如语音与说话人识别。近来,语音SSL模型还被证明有助于推进口语语言理解任务,这意味着SSL模型有潜力学习到不仅是声学还有语言的信息。本文旨在阐明语音SSL技术能否良好捕获语言知识。为此,我们引入了SpeechGLUE,即通用语言理解评估(GLUE)基准的语音版本。由于GLUE包含多种自然语言理解任务,SpeechGLUE可阐明语音SSL模型语言能力的程度。实验表明,语音SSL模型虽逊于基于文本的SSL模型,但优于基线,说明其仅从未标注语音数据中即可获取一定量的通用语言知识。
引用
@article{arxiv.2306.08374,
title = {SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?},
author = {Takanori Ashihara and Takafumi Moriya and Kohei Matsuura and Tomohiro Tanaka and Yusuke Ijima and Taichi Asami and Marc Delcroix and Yukinori Honma},
journal= {arXiv preprint arXiv:2306.08374},
year = {2024}
}
备注
Accepted at INTERSPEECH 2023. This paper has been extended in a subsequent journal paper, see https://ieeexplore.ieee.org/abstract/document/10597571