shell 中的误友:揭示大语言模型中的表情符号语义混淆
密码学与安全
2026-05-05 v2 人工智能
软件工程
摘要
表情符号在数字通信中广泛用于传递情感意图,但就大语言模型(LLMs)的安全性影响而言,其影响仍鲜为人知。本文我们识别了表情符号语义混淆,这是一种漏洞,导致LLMs误解基于ASCII的表情符号,以执行意外甚至破坏性的动作。为系统性地研究这一现象,我们开发了一个自动化数据生成管道,构建了一个包含3,757个面向代码的测试案例的数据集,涵盖21种元情景、四种编程语言以及不同的上下文复杂性。我们对六种LLMs的研究显示,表情符号语义混淆普遍存在,平均混淆比率超过38%。更关键的是,超过90%的混淆响应导致“静默失败”,即语法上有效的输出但偏离用户意图,可能导致破坏性的安全后果。此外,我们观察到这一漏洞容易转移到流行的代理框架中,而现有的基于提示的缓解措施基本无效。我们呼吁社区认识这一新兴漏洞,并开发有效的缓解方法,以维护LLM系统的安全性和可靠性。
引用
@article{arxiv.2601.07885,
title = {False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models},
author = {Weipeng Jiang and Xiaoyu Zhang and Juan Zhai and Shiqing Ma and Chao Shen and Yang Liu},
journal= {arXiv preprint arXiv:2601.07885},
year = {2026}
}