中文

基于联合CTC损失与自监督预训练声学编码器的端到端口语理解

计算与语言 2023-06-05 v2 声音 音频与语音处理

摘要

由于缺少文本信息,在口语理解(SLU)中直接从音频信号提取语义具有挑战性。流行的端到端(E2E)SLU模型利用序列到序列自动语音识别(ASR)模型提取文本嵌入作为推断语义的输入,但这需要计算代价高昂的自回归解码。本工作中,我们利用经连接主义时序分类(CTC)微调的自监督声学编码器提取文本嵌入,并采用联合CTC与SLU损失用于话语级SLU任务。实验表明,我们的模型在DSTC2数据集上比最先进的(SOTA)对话行为分类模型绝对提升4%,在SLURP数据集上比SOTA SLU模型绝对提升1.3%。

关键词

引用

@article{arxiv.2305.02937,
  title  = {End-to-end spoken language understanding using joint CTC loss and self-supervised, pretrained acoustic encoders},
  author = {Jixuan Wang and Martin Radfar and Kai Wei and Clement Chung},
  journal= {arXiv preprint arXiv:2305.02937},
  year   = {2023}
}

备注

ICASSP 2023