面对对抗否定攻击的 Google Perspective API:迈向防御性视角
人工智能
2026-02-11 v1 计算与语言
摘要
涉及有毒评论的社交媒体平台网络欺凌现象日益严重,亟需有效方法来监控和审管线上交互。现有基于机器或深度学习算法的自动毒性检测系统面临挑战,统计方法通常易受包含逻辑修改的否定词汇和句子构成的对抗攻击。为此,我们提出一套形式化推理方法,包装现有的机器学习毒性检测系统。作为前处理和后处理步骤,我们的形式化推理包装器有助于缓解否定攻击问题,显著提高毒性评分的准确性和有效性。我们在多个机器学习模型上评估了该包装器的不同变体,并针对否定对抗数据集进行测试。实验结果表明,混合方法(形式化推理与机器学习)在应对各种纯统计解决方案方面具有显著优势。
引用
@article{arxiv.2602.09343,
title = {Not-in-Perspective: Towards Shielding Google's Perspective API Against Adversarial Negation Attacks},
author = {Michail S. Alexiou and J. Sukarno Mertoguno},
journal= {arXiv preprint arXiv:2602.09343},
year = {2026}
}