使用 Performer 与 Agent Attention 进行语音语言识别
音频与语音处理
2025-02-11 v1 声音
摘要
语音语言识别(LID)的一种方法是从预训练模型中提取语音表示,然后进行自监督学习,随后对模型进行微调以完成LID任务。最新方法使用基于注意力的统计池化层来促进跨时间帧嵌入向量中上下文信息的聚合。本文深入探索了最近提出的注意力机制——Performer 和 Agent Attention——与统计池化层的结合。我们在三个数据集上进行LID实验:VoxPopuli、FLEURS 和 VoxLingua。我们将其性能与基础自注意力进行比较。我们的发现表明,Performer 注意力优于自注意力和 Agent Attention 在某些情况下表现与自注意力相当或更好,同时还能更低的计算成本。
引用
@article{arxiv.2502.05841,
title = {On the use of Performer and Agent Attention for Spoken Language Identification},
author = {Jitendra Kumar dhiman and Jainag Ambati},
journal= {arXiv preprint arXiv:2502.05841},
year = {2025}
}
备注
5 pages, 1 figure