CoGate-LSTM:基于原型引导的特征空间门控用于缓解不平衡有毒评论分类中的梯度稀释
摘要
有毒文本分类在线社区审核面临挑战,面对极端类别不平衡时,罕见但高风险标签如 threat 和 severe_toxic 常被常规模型漏检。在此基础上,我们提出 CoGate-LSTM,一种基于余弦相似度特征门控机制的高效循环网络架构,该机制通过对已学习的有毒原型到词嵌入方向的相似性进行自适应缩放来调整 token 嵌入。与基于 token 位置的注意力不同,门控强调对少数有毒类别最具信息性的特征方向。在模型中,冻结的多源嵌入(GloVe、FastText 和 BERT-CLS)、字符级 BiLSTM、嵌入空间 SMOTE 以及加权 focal loss 组合使用。在 Jigsaw 有毒评论基准上,CoGate-LSTM 实现 0.881 的宏 F1 分数(95% 置信区间:[0.873, 0.889])和 96.0% 的准确率,超越微调 BERT 提升 6.9 个宏 F1 分数(p < 0.001),超越 XGBoost 提升 4.7,同时仅使用 730 万参数(约 BERT 的 15 倍)和 48ms CPU 推理延迟。提升在少数标签上最为显著,severe_toxic 提升 +71% 的 F1,threat 提升 +33%,identity_hate 提升 +28%。消融实验识别出余弦门控是主要驱动因素(移除后宏 F1 下降 4.8),字符级融合(-2.4)和多头注意力(-2.9)还有额外收益。CoGate-LSTM 也在数据集之间合理迁移,在 Contextual Abuse 数据集上实现 0.71 的宏 F1 零样本,轻量阈值适应后达到 0.73。这些结果表明,面向不平衡有毒评论的方向感知特征门控为大规模全参数 transformer 分类提供了一种有效且高效的替代方案。
引用
@article{arxiv.2510.17018,
title = {CoGate-LSTM: Prototype-Guided Feature-Space Gating for Mitigating Gradient Dilution in Imbalanced Toxic Comment Classification},
author = {Noor Islam S. Mohammad},
journal= {arXiv preprint arXiv:2510.17018},
year = {2026}
}