中文

用于音频-文本分类的级联跨模态Transformer

计算与语言 2024-07-26 v2 机器学习 声音 音频与语音处理

摘要

语音分类任务通常需要强大的语言理解模型来获取有用特征,当可用的训练数据有限时,这便成为问题。为了获得优越的分类性能,我们提出利用多模态表征的内在价值,通过使用自动语音识别(ASR)模型转写语音,并通过预训练的翻译模型将转录文本翻译成不同语言。由此,我们为每个数据样本获得了音频-文本(多模态)表征。随后,我们通过一种新颖的级联跨模态Transformer(CCMT),将语言特定的双向编码器表示(BERT)与Wav2Vec2.0音频特征相结合。我们的模型基于两个级联的Transformer模块。第一个模块结合了来自不同语言的文本特定特征,而第二个模块则将声学特征与第一个Transformer模块先前学到的多语言特征相结合。我们在ACM Multimedia 2023计算副语言学挑战赛的请求子挑战中应用了我们的系统。CCMT被宣布为获胜方案,在投诉和请求检测上分别获得了65.41%和85.87%的未加权平均召回率(UAR)。此外,我们将该框架应用于Speech Commands v2和HarperValleyBank对话数据集,超越了此前在这些基准上报告结果的研究。我们的代码可在以下地址免费下载:https://github.com/ristea/ccmt。

关键词

引用

@article{arxiv.2401.07575,
  title  = {Cascaded Cross-Modal Transformer for Audio-Textual Classification},
  author = {Nicolae-Catalin Ristea and Andrei Anghel and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2401.07575},
  year   = {2024}
}

备注

Accepted for publication in Artificial Intelligence Review