中文

文本、声学与基于词格的表示在口语理解任务中的有效性

计算与语言 2024-02-02 v2 人工智能 声音 音频与语音处理

摘要

在本文中,我们对不同表示进行了详尽评测,以解决口语理解(SLU)设定下的意图分类问题。我们对三类执行 SLU 意图检测任务的系统进行了基准测试:1)基于文本的,2)基于词格的,以及一种新颖的 3)多模态方法。我们的工作全面分析了不同最先进 SLU 系统在不同情形(例如自动生成与人工生成转录文本)下可取得的性能。我们在公开可用的 SLURP 口语资源语料库上评测这些系统。我们的结果表明,使用更丰富的自动语音识别(ASR)输出形式,即词共识网络,使 SLU 系统相比 1-best 设定有所提升(相对提升 5.5%)。然而,跨模态方法,即从声学与文本嵌入中学习,取得了与 oracle 设定相近的性能,相对 1-best 配置提升 17.8%,是克服使用自动生成转录文本局限性的推荐替代方案。

关键词

引用

@article{arxiv.2212.08489,
  title  = {Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks},
  author = {Esaú Villatoro-Tello and Srikanth Madikeri and Juan Zuluaga-Gomez and Bidisha Sharma and Seyyed Saeed Sarfjoo and Iuliia Nigmatulina and Petr Motlicek and Alexei V. Ivanov and Aravind Ganapathiraju},
  journal= {arXiv preprint arXiv:2212.08489},
  year   = {2024}
}

备注

Accepted in ICASSP 2023