中文

通过对比采样与不确定性估计学习鲁棒表示以检测恶意内容

机器学习 2025-12-11 v1 人工智能

摘要

我们提出了不确定性对比框架(UCF),一个正-无标签(PU)表示学习框架,集成了不确定性感知的对比损失、自适应温度缩放和自注意力引导的 LSTM 编码器,以改善在噪声和不平衡条件下的分类。UCF 根据样本置信度动态调整对比权重,通过正样本锚点稳定训练,并自适应温度参数以适应批次级别的变化。应用于恶意内容分类,UCF 生成的嵌入使多个传统分类器实现了超过 93.38% 的准确率、精确率高于 0.93 以及接近完美的召回率,同时具有极少的假阴性和有竞争力的 ROC-AUC 分数。可视化分析确认了正样本和无标签实例之间的清晰分离,突显了该框架生成校准良好、具有判别力的嵌入的能力。这些结果使 UCF 成为 PU 学习在高风险领域(如网络安全和生物医学文本挖掘)中的一项稳健且可扩展的解决方案。

关键词

引用

@article{arxiv.2512.08969,
  title  = {Learning Robust Representations for Malicious Content Detection via Contrastive Sampling and Uncertainty Estimation},
  author = {Elias Hossain and Umesh Biswas and Charan Gudla and Sai Phani Parsa},
  journal= {arXiv preprint arXiv:2512.08969},
  year   = {2025}
}