中文

利用语音-文本对齐增强多语言语音毒性检测

计算与语言 2024-11-19 v1 机器学习 音频与语音处理

摘要

语音的毒性分类在很大程度上依赖于语音的语义内容。我们提出了一个新颖的框架,该框架利用跨模态学习,在训练期间将文本的语义嵌入整合到多标签语音毒性分类器中。这使得我们能够在训练期间纳入文本信息,同时在推理时仅需要音频。我们在具有真实世界特征的大规模数据集上评估了这个分类器,以验证该框架的有效性。通过消融研究,我们证明了通用语义文本嵌入是丰富的,并且与用于毒性分类目的的语音对齐。通过跨多种语言的大规模实验,我们展示了在五种语言和不同毒性类别中语音毒性分类的改进。

关键词

引用

@article{arxiv.2406.10325,
  title  = {Enhancing Multilingual Voice Toxicity Detection with Speech-Text Alignment},
  author = {Joseph Liu and Mahesh Kumar Nandwana and Janne Pylkkönen and Hannes Heikinheimo and Morgan McGuire},
  journal= {arXiv preprint arXiv:2406.10325},
  year   = {2024}
}

备注

Accepted to INTERSPEECH 2024