中文

超越内容:融合副语言线索的全面语音毒性数据集与检测框架

声音 2026-05-18 v1 人工智能 密码学与安全

摘要

语音毒性检测已成为维护安全在线交流环境的关键挑战。然而,现有的语音毒性检测方法常常忽略副语言线索(如情感、语调和语速)的作用,而这些线索是检测语音毒性的关键。此外,当前的语音毒性数据集主要基于文本,限制了能够捕捉副语言线索的模型的发展。为应对这些挑战,我们提出了ToxiAlert-Bench,这是一个大规模音频数据集,包含超过30,000个音频片段,标注了七个主要毒性类别和二十个细粒度毒性标签。独特之处在于,我们的数据集标注了毒性来源——区分文本内容和副语言来源——以进行全面的语音毒性分析。此外,我们提出了一种专为语音毒性检测设计的双头神经网络,并采用多阶段训练策略。该架构具有两个特定任务的分类头:一个用于识别敏感性来源(文本或副语言),另一个用于对具体的毒性类型进行分类。训练过程包括独立的头部训练,随后进行联合微调以减少任务干扰。为缓解数据类别不平衡,我们引入了类别平衡采样和加权损失函数。实验结果表明,利用副语言特征显著提升了检测性能。我们的方法在多个评估指标上始终优于现有基线,相比最强基线,Macro-F1分数相对提升21.1%,准确率相对提升13.0%,突显了其增强的有效性和实际应用性。

关键词

引用

@article{arxiv.2605.15984,
  title  = {Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues},
  author = {Zhongjie Ba and Liang Yi and Peng Cheng and Qingcao Li and Qinglong Wang and Li Lu},
  journal= {arXiv preprint arXiv:2605.15984},
  year   = {2026}
}