探究自监督语音模型中自注意力机制的跨语言差异
计算与语言
2024-09-06 v1 机器学习
摘要
得益于新型 Transformer 架构带来的准确率提升,语音模型受到了广泛关注。尽管在自动语音识别(ASR)基准测试上的性能提升令人瞩目,但关于注意力机制在语音相关任务中的应用仍有诸多未知。例如,虽然假设这些模型正在学习与语言无关(即通用)的语音表示,但目前尚未深入探讨模型与语言无关究竟意味着什么。在本文中,我们在一个小型自监督语音 Transformer 模型(TERA)的自注意力机制范围内探讨了这一问题。我们发现,即使是小型模型,所学到的注意力头也表现出多样性,从几乎完全对角化到几乎完全全局化,且与训练语言无关。我们重点指出了土耳其语和英语在注意力模式上的一些显著差异,并证明模型在预训练期间确实学到了重要的音系信息。我们还进行了一项注意力头消融研究,结果表明跨语言模型主要依赖对角头来进行音素分类。
引用
@article{arxiv.2409.03115,
title = {Probing self-attention in self-supervised speech models for cross-linguistic differences},
author = {Sai Gopinath and Joselyn Rodriguez},
journal= {arXiv preprint arXiv:2409.03115},
year = {2024}
}
备注
10 pages, 18 figures