利用语音-文本对齐增强多语言语音毒性检测
计算与语言
2024-11-19 v1 机器学习
音频与语音处理
摘要
语音的毒性分类在很大程度上依赖于语音的语义内容。我们提出了一个新颖的框架,该框架利用跨模态学习,在训练期间将文本的语义嵌入整合到多标签语音毒性分类器中。这使得我们能够在训练期间纳入文本信息,同时在推理时仅需要音频。我们在具有真实世界特征的大规模数据集上评估了这个分类器,以验证该框架的有效性。通过消融研究,我们证明了通用语义文本嵌入是丰富的,并且与用于毒性分类目的的语音对齐。通过跨多种语言的大规模实验,我们展示了在五种语言和不同毒性类别中语音毒性分类的改进。
引用
@article{arxiv.2406.10325,
title = {Enhancing Multilingual Voice Toxicity Detection with Speech-Text Alignment},
author = {Joseph Liu and Mahesh Kumar Nandwana and Janne Pylkkönen and Hannes Heikinheimo and Morgan McGuire},
journal= {arXiv preprint arXiv:2406.10325},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024