中文

音频 transformer 模型究竟听到了什么?探究用于语言表达及其结构的声学表征

计算与语言 2021-07-14 v2 机器学习 声音 音频与语音处理

摘要

近来,基于 BERT 的 transformer 模型已成为文本处理模型“技术栈”中不可分割的一部分。在语音领域也观察到类似的进展,众多模型通过使用音频 transformer 模型编码语音取得了最先进的结果。这就引出了一个问题:这些音频 transformer 模型在学习什么。此外,尽管标准方法是为任何下游任务选择最后一层嵌入,但这是最优选择吗?我们尝试为两个近期音频 transformer 模型 Mockingjay 和 wave2vec2.0 回答这些问题。我们在包括音频、流畅度和发音特征在内的详尽语言表达和结构特征集上比较它们。此外,我们探究音频模型对文本表层、句法和语义特征的理解,并将其与 BERT 比较。我们在针对母语、非母语、合成、朗读和自发语音数据集的详尽设置上进行了此工作。

关键词

引用

@article{arxiv.2101.00387,
  title  = {What all do audio transformer models hear? Probing Acoustic Representations for Language Delivery and its Structure},
  author = {Jui Shah and Yaman Kumar Singla and Changyou Chen and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2101.00387},
  year   = {2021}
}