中文

BeAts:基于多模态注意力融合的孟加拉语言语行为识别

计算与语言 2023-06-06 v1 机器学习 声音 音频与语音处理

摘要

口语常利用语调、节奏、强度和结构来传达意图,而这些意图会因说话节奏的不同而被不同地解读。这些言语行为构成了交流的基础,并在表达上因语言而异。近期基于注意力的模型取得了进展,显示出其从多语言数据集中学习强大表征的能力,在语音任务中表现良好,非常适合对低资源语言中的特定任务进行建模。在此,我们开发了一种新颖的多模态方法,结合 wav2vec2.0(用于音频)和 MarianMT(用于文本翻译)两个模型,通过多模态注意力融合来预测我们所构建的孟加拉语语音语料库中的言语行为。我们还表明,我们的模型 BeAts(基于多模态注意力融合的孟加拉语言语行为识别,\underline{\textbf{Be}}ngali speech acts recognition using Multimodal \underline{\textbf{At}}tention Fu\underline{\textbf{s}}ion)显著优于仅使用语音数据的单模态基线以及使用语音和文本数据的较简单双模态融合。项目页面:https://soumitri2001.github.io/BeAts

关键词

引用

@article{arxiv.2306.02680,
  title  = {BeAts: Bengali Speech Acts Recognition using Multimodal Attention Fusion},
  author = {Ahana Deb and Sayan Nag and Ayan Mahapatra and Soumitri Chattopadhyay and Aritra Marik and Pijush Kanti Gayen and Shankha Sanyal and Archi Banerjee and Samir Karmakar},
  journal= {arXiv preprint arXiv:2306.02680},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2023