音频 transformer 模型究竟听到了什么?探究用于语言表达及其结构的声学表征
计算与语言
2021-07-14 v2 机器学习
声音
音频与语音处理
摘要
近来,基于 BERT 的 transformer 模型已成为文本处理模型“技术栈”中不可分割的一部分。在语音领域也观察到类似的进展,众多模型通过使用音频 transformer 模型编码语音取得了最先进的结果。这就引出了一个问题:这些音频 transformer 模型在学习什么。此外,尽管标准方法是为任何下游任务选择最后一层嵌入,但这是最优选择吗?我们尝试为两个近期音频 transformer 模型 Mockingjay 和 wave2vec2.0 回答这些问题。我们在包括音频、流畅度和发音特征在内的详尽语言表达和结构特征集上比较它们。此外,我们探究音频模型对文本表层、句法和语义特征的理解,并将其与 BERT 比较。我们在针对母语、非母语、合成、朗读和自发语音数据集的详尽设置上进行了此工作。
引用
@article{arxiv.2101.00387,
title = {What all do audio transformer models hear? Probing Acoustic Representations for Language Delivery and its Structure},
author = {Jui Shah and Yaman Kumar Singla and Changyou Chen and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2101.00387},
year = {2021}
}