中文

WaBERT:一种用于口语语言理解与语音到BERT对齐的低资源端到端模型

计算与语言 2022-04-25 v1 声音 音频与语音处理

摘要

历史上,自动语音识别(ASR)和说话人识别等较低层次任务一直是语音领域的主要焦点。近来,情感分析(SA)等较高层次的口语语言理解(SLU)任务日益受到关注。然而,提升SLU任务的性能仍是一大挑战。基本上,SLU任务有两类主要方法:(1)两阶段方法,使用语音模型将语音转为文本,再用语言模型得到下游任务的结果;(2)单阶段方法,仅微调预训练语音模型以适应下游任务。第一种方法丢失了语调等情感线索,并在ASR过程中造成识别错误,第二种则缺乏必要的语言知识。本文提出Wave BERT(WaBERT),一种结合语音模型与语言模型用于SLU任务的新型端到端模型。WaBERT基于预训练的语音和语言模型,因此无需从头训练。我们还在训练过程中冻结了WaBERT的大部分参数。通过引入WaBERT,在短时低资源训练过程中集成了音频特有信息与语言知识,使SLUE SA任务开发集上的召回率提升1.15%、F1分数提升0.82%。此外,我们改进了串行连续积分触发(CIF)机制,以实现语音与文本模态间的单调对齐。

关键词

引用

@article{arxiv.2204.10461,
  title  = {WaBERT: A Low-resource End-to-end Model for Spoken Language Understanding and Speech-to-BERT Alignment},
  author = {Lin Yao and Jianfei Song and Ruizhuo Xu and Yingfang Yang and Zijian Chen and Yafeng Deng},
  journal= {arXiv preprint arXiv:2204.10461},
  year   = {2022}
}