中文

MMBERT:规模化混合专家多模态 BERT 用于面对遮掩扰动的中文仇恨言论检测

计算与语言 2025-08-04 v1 人工智能

摘要

中文社交网络的仇恨言论检测面临独特挑战,尤其是因广泛使用遮掩技巧以规避传统基于文本的检测系统。虽然大型语言模型(LLM)最近显著提升了仇恨言论检测能力,但大多数研究集中于英文数据集,对中文语境下的多模态策略关注有限。本研究提出 MMBERT,一种 novel 基于 BERT 的多模态框架,通过混合专家(MoE)架构整合文本、语音和视觉模态。为解决 MoE 直接集成到 BERT 模型中导致的不稳定问题,我们发展了渐进式三阶段训练范式。MMBERT 包含模态特定专家、共享自注意力机制以及基于路由器的专家分配策略,以增强对对抗扰动的鲁棒性。实证结果表明,在多个中文仇恨言论数据集上,MMBERT 显著优于微调的 BERT 编码器模型、微调的 LLM 以及利用 in-context 学习的 LLM。

关键词

引用

@article{arxiv.2508.00760,
  title  = {MMBERT: Scaled Mixture-of-Experts Multimodal BERT for Robust Chinese Hate Speech Detection under Cloaking Perturbations},
  author = {Qiyao Xue and Yuchen Dou and Ryan Shi and Xiang Lorraine Li and Wei Gao},
  journal= {arXiv preprint arXiv:2508.00760},
  year   = {2025}
}