样式攻击伪装:当字体成为对抗意图的掩体
计算与语言
2025-10-23 v1 人工智能
摘要
随着社交媒体的增长,用户采用样式字体和类似字体的表情符号表达个性,创建具有视觉吸引力且人类可读的文本。然而,这些字体引入了 NLP 模型的隐藏漏洞:虽然人类轻松阅读样式文本,但模型将这些字符处理为 distinct 的标记,造成干扰。我们识别了人类-模型感知差距,提出一种基于样式的攻击,样式攻击伪装(Style Attack Disguise, SAD)。我们设计两种规模:轻型用于查询效率,强型用于卓越的攻击性能。在情感分类和机器翻译任务上,对传统模型、LLM 和商业服务进行实验,表明 SAD 具备强大的攻击性能。我们还展示了 SAD 对多模态任务(包括文本到图像和文本到语音生成)的潜在威胁。
引用
@article{arxiv.2510.19641,
title = {Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent},
author = {Yangshijie Zhang and Xinda Wang and Jialin Liu and Wenqiang Wang and Zhicong Ma and Xingxing Jia},
journal= {arXiv preprint arXiv:2510.19641},
year = {2025}
}