中文

基于 Transformer 的编码-编码架构用于语音关键词检索

计算与语言 2022-11-03 v1 声音 音频与语音处理

摘要

本文提出一种基于 Transformer 架构的语音关键词检索方法。我们提出编码-编码架构,采用两个类 BERT 编码器并带有额外修改,包括卷积与上采样层、注意力掩码和参数共享。编码器将识别假设与待检索词投影到共享嵌入空间,其中候选命中的得分通过校准点积计算。实验中,我们使用 Wav2Vec 2.0 语音识别器,所提系统在基于 USC Shoah Foundation Visual History Archive(MALACH)的英语和捷克语 STD 数据集上优于基于深度 LSTM 的基线方法。

关键词

引用

@article{arxiv.2211.01089,
  title  = {Transformer-based encoder-encoder architecture for Spoken Term Detection},
  author = {Jan Švec and Luboš Šmídl and Jan Lehečka},
  journal= {arXiv preprint arXiv:2211.01089},
  year   = {2022}
}

备注

Submitted to ICASSP 2023