中文

面向开放词汇关键词 spotting 的音频-文本一致性学习

音频与语音处理 2022-07-04 v2 人工智能 机器学习

摘要

本文提出一种新颖的端到端用户自定义关键词 spotting 方法,利用语音与文本序列之间语言上对应的模式。与以往需要语音关键词注册的方法不同,我们的方法将输入查询与注册文本关键词序列进行比较。为将音频与文本表示置于一个共同的潜在空间中,我们采用基于注意力的跨模态匹配方法,以端到端方式通过单调匹配损失与关键词分类损失进行训练。我们还对声学嵌入网络使用去噪损失,以提升在噪声环境中的鲁棒性。此外,我们引入LibriPhrase数据集,一个基于LibriSpeech的新的短短语数据集,用于高效训练关键词 spotting 模型。与其他单模态及跨模态基线相比,我们提出的方法在各个评测集上取得了有竞争力的结果。

关键词

引用

@article{arxiv.2206.15400,
  title  = {Learning Audio-Text Agreement for Open-vocabulary Keyword Spotting},
  author = {Hyeon-Kyeong Shin and Hyewon Han and Doyeon Kim and Soo-Whan Chung and Hong-Goo Kang},
  journal= {arXiv preprint arXiv:2206.15400},
  year   = {2022}
}

备注

Accepted to Interspeech 2022