使用对比训练的 Transformer 声学词嵌入实现低资源关键词检测
音频与语音处理
2025-06-24 v1
摘要
我们引入了一种新方法 ContrastiveTransformer,用于生成声学词嵌入,以实现极低资源的关键词检测。ContrastiveTransformer 是一个仅编码器模型,使用归一化温度缩放交叉熵(NT-Xent)损失直接优化嵌入空间。我们使用该模型对卢干达语和巴马纳语(后者是一种严重缺乏资源的语言)的广播进行关键词检测。我们将我们的模型与各种现有的声学词嵌入方法进行了比较,包括由大型预训练自监督模型构建的方法、先前使用 NT-Xent 损失的循环编码器,以及 DTW 基线。我们证明,所提出的对比 Transformer 方法在两种语言的所有现有极低资源关键词检测方法上均提供了性能提升。
关键词
引用
@article{arxiv.2506.17690,
title = {Low-resource keyword spotting using contrastively trained transformer acoustic word embeddings},
author = {Julian Herreilers and Christiaan Jacobs and Thomas Niesler},
journal= {arXiv preprint arXiv:2506.17690},
year = {2025}
}
备注
5 pages, 2 figures