中文

一种用于口语话语中不流畅检测的新型多模态动态融合网络

计算与语言 2022-11-29 v1 音频与语音处理

摘要

不流畅现象虽源于人类口语话语,但主要被作为基于单模态文本的自然语言处理(NLP)任务来研究。基于文本与声学模态之间的早期融合和基于自注意力的多模态交互,本文提出了一种用于从单个话语中检测不流畅的新型多模态架构。我们的架构利用多模态动态融合网络,在先前方法中常用的现有文本编码器上仅增加极少参数,以利用语音中隐藏的韵律与声学线索。通过实验,我们表明所提模型在广泛使用的英语 Switchboard 不流畅检测数据集上取得了最先进结果,并以显著优势超越文献中先前的单模态与多模态系统。此外,我们进行了详尽的定性分析,表明与受数据中虚假相关性影响的纯文本系统不同,我们的系统通过来自语音信号的额外线索克服了该问题。我们已在 GitHub 上公开所有代码。

关键词

引用

@article{arxiv.2211.14700,
  title  = {A novel multimodal dynamic fusion network for disfluency detection in spoken utterances},
  author = {Sreyan Ghosh and Utkarsh Tyagi and Sonal Kumar and Manan Suri and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2211.14700},
  year   = {2022}
}

备注

Submitted to ICASSP 2023. arXiv admin note: text overlap with arXiv:2203.16794