中文

U-GIFT:少样本场景下针对有毒语音的不确定性引导防火墙

声音 2025-01-03 v1 计算与语言 音频与语音处理

摘要

随着社交媒体的广泛使用,在线平台上的用户生成内容激增。当此类内容包含仇恨、辱骂、冒犯或网络欺凌行为时,即被归类为有毒语音,对在线生态系统的完整性与安全构成重大威胁。尽管人工内容审核仍占主导,但海量的内容及对人工审核员造成的心理压力凸显了自动有毒语音检测的需求。先前提出的检测方法通常依赖大型标注数据集;然而,在实践中获取此类数据集既昂贵又具挑战性。为解决此问题,我们提出了一种用于少样本场景下有毒语音的不确定性引导防火墙U-GIFT,该系统利用自训练在标记数据有限的情况下增强检测性能。具体而言,U-GIFT将主动学习与贝叶斯神经网络相结合,从无标签数据中自动识别高质量样本,并基于模型预测导出的不确定性估计,优先选择置信度较高的伪标签进行训练。大量实验表明,U-GIFT在少样本检测场景中显著优于具有竞争力的基线方法。在5-shot设置下,其性能比基础模型提升了14.92%。重要的是,U-GIFT对用户友好,可适应各种预训练语言模型。它在样本不平衡和跨领域设置的场景中也表现出稳健的性能,并在各种语言应用中展现出强大的泛化能力。我们相信U-GIFT为少样本有毒语音检测提供了高效解决方案,为网络空间中的自动内容审核提供了实质性支持,从而作为防火墙促进网络安全的发展。

关键词

引用

@article{arxiv.2501.00907,
  title  = {U-GIFT: Uncertainty-Guided Firewall for Toxic Speech in Few-Shot Scenario},
  author = {Jiaxin Song and Xinyu Wang and Yihao Wang and Yifan Tang and Ru Zhang and Jianyi Liu and Gongshen Liu},
  journal= {arXiv preprint arXiv:2501.00907},
  year   = {2025}
}

备注

16 pages, 6 figures and 10 tables. Comments are welcome