笑脸变得有害:解读 Emoji 如何触发大语言模型的有害输出
计算与语言
2025-09-16 v1
摘要
Emoji 在数字通信中是全球通用的非语言线索,广泛研究探讨了大语言模型(LLM)如何理解和利用 Emoji 在不同语境下的含义。虽然通常与友好或愉悦相关,但观察到 Emoji 可能触发 LLM 的有害内容生成。以此为动机,我们旨在调查:(1)Emoji 是否能明确增强 LLM 的有害生成,(2)如何解读这一现象。我们首先通过自动构建带 Emoji 提示词来探索 Emoji 触发的 LLM 有害生成,利用 Emoji 轻微表达有害意图。针对 7 个主流语言和 7 个著名 LLM 进行实验,同时进行越狱任务,结果显示带 Emoji 的提示词能够轻易诱导有害生成。为理解这一现象,我们进行模型层面的解释,涵盖语义认知、序列生成和分词,表明 Emoji 可作为异构语义通道以规避安全机制。为深入洞察,我们进一步探测了预训练语料库,发现 Emoji 相关数据污染与有害生成行为之间存在潜在关联。补充材料提供我们的实现代码和数据。(警告:本文包含可能敏感的内容)
引用
@article{arxiv.2509.11141,
title = {When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity},
author = {Shiyao Cui and Xijia Feng and Yingkang Wang and Junxiao Yang and Zhexin Zhang and Biplab Sikdar and Hongning Wang and Han Qiu and Minlie Huang},
journal= {arXiv preprint arXiv:2509.11141},
year = {2025}
}