基于 Transformer 的编码-编码架构用于语音关键词检索
计算与语言
2022-11-03 v1 声音
音频与语音处理
摘要
本文提出一种基于 Transformer 架构的语音关键词检索方法。我们提出编码-编码架构,采用两个类 BERT 编码器并带有额外修改,包括卷积与上采样层、注意力掩码和参数共享。编码器将识别假设与待检索词投影到共享嵌入空间,其中候选命中的得分通过校准点积计算。实验中,我们使用 Wav2Vec 2.0 语音识别器,所提系统在基于 USC Shoah Foundation Visual History Archive(MALACH)的英语和捷克语 STD 数据集上优于基于深度 LSTM 的基线方法。
引用
@article{arxiv.2211.01089,
title = {Transformer-based encoder-encoder architecture for Spoken Term Detection},
author = {Jan Švec and Luboš Šmídl and Jan Lehečka},
journal= {arXiv preprint arXiv:2211.01089},
year = {2022}
}
备注
Submitted to ICASSP 2023