中文

与我交谈或对话:支持灵活输入的端到端口语理解系统

计算与语言 2021-06-15 v2 机器学习 声音 音频与语音处理

摘要

近期口语理解(SLU)研究的重点之一是端到端方法,即单一模型可直接从语音输入预测意图而无需中间转写文本。然而该方法存在一些挑战。首先,由于语音可视为个人身份信息,某些情况下仅能获取自动语音识别(ASR)转写文本。其次,带意图标注的语音数据稀缺。针对第一点挑战,我们提出一种可从灵活类型输入(语音、ASR 转写文本或二者兼具)预测意图的新型系统。我们展示了各单一模态的强劲性能,而当语音与 ASR 转写文本均可用时,通过系统组合取得了优于单一输入模态的结果。针对第二点挑战,我们利用语义鲁棒的预训练 BERT 模型并采用在共享潜在空间中联合训练文本嵌入与声学嵌入的跨模态系统。我们通过使用在 LibriSpeech 上预训练的声学模块并在目标数据集上对文本模块进行领域自适应进一步增强该系统。我们的实验显示了这些预训练与微调策略的显著优势,从而构建出在 Snips SLU 与 Fluent Speech Commands 数据集上取得具竞争力意图分类性能的系统。

关键词

引用

@article{arxiv.2104.05752,
  title  = {Speak or Chat with Me: End-to-End Spoken Language Understanding System with Flexible Inputs},
  author = {Sujeong Cha and Wangrui Hou and Hyun Jung and My Phung and Michael Picheny and Hong-Kwang Kuo and Samuel Thomas and Edmilson Morais},
  journal= {arXiv preprint arXiv:2104.05752},
  year   = {2021}
}

备注

Accepted to Interspeech 2021