中文

一图胜千言毒语:面向内容审核软件的蜕变测试框架

软件工程 2023-08-22 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

社交媒体平台的指数级增长给人类社会的交流与内容传播带来了革命。然而,这些平台正日益被滥用于传播有毒内容,包括仇恨言论、恶意广告和色情内容,导致诸如损害青少年心理健康等严重负面后果。尽管在开发和部署文本与图像内容审核方法方面已付出巨大努力,恶意用户仍可通过将文本嵌入图像(如文本截图,通常带有一定干扰)来规避审核。我们发现,现代内容审核软件针对此类恶意输入的防护性能仍缺乏充分研究。在本工作中,我们提出 OASIS,一个面向内容审核软件的蜕变测试框架。OASIS 采用了从我们在 4 个流行社交媒体应用(包括 Twitter、Instagram、新浪微博和百度贴吧)收集的 5000 条真实有毒内容的试点研究中总结出的 21 条变换规则。给定有毒文本内容,OASIS 可生成保留毒性却可能绕过审核的图像测试用例。在评估中,我们使用 OASIS 测试了来自知名公司(即 Google Cloud、Microsoft Azure、百度云、阿里云和腾讯云)的五款商业文本内容审核软件,以及一个最先进的审核研究模型。结果表明,OASIS 的查错率高达 100%。此外,通过使用 OASIS 生成的测试用例对模型进行重新训练,可在不降低性能的情况下提升审核模型的鲁棒性。

关键词

引用

@article{arxiv.2308.09810,
  title  = {An Image is Worth a Thousand Toxic Words: A Metamorphic Testing Framework for Content Moderation Software},
  author = {Wenxuan Wang and Jingyuan Huang and Jen-tse Huang and Chang Chen and Jiazhen Gu and Pinjia He and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2308.09810},
  year   = {2023}
}

备注

Accepted by ASE 2023. arXiv admin note: substantial text overlap with arXiv:2302.05706