中文

Finstreder:基于有限状态 transducer 与现代语音识别模型的高效口语理解方法

计算与语言 2022-06-30 v1 人机交互 声音 音频与语音处理

摘要

在口语理解(SLU)中,任务是从音频指令中提取重要信息,如用户希望系统执行的意图,以及地点或数字等特殊实体。本文提出一种将意图与实体嵌入有限状态 transducer 的简单方法,并结合预训练通用语音转文本模型,无需任何额外训练即可构建 SLU 模型。构建这些模型非常快,仅需几秒,且完全语言无关。通过在多个基准上的比较表明,该方法可以优于多种其他资源消耗更大的 SLU 方法。

关键词

引用

@article{arxiv.2206.14589,
  title  = {Finstreder: Simple and fast Spoken Language Understanding with Finite State Transducers using modern Speech-to-Text models},
  author = {Daniel Bermuth and Alexander Poeppel and Wolfgang Reif},
  journal= {arXiv preprint arXiv:2206.14589},
  year   = {2022}
}