中文

EmoRAG:评估 RAG 系统对符号扰动的鲁棒性

密码学与安全 2025-12-02 v1 人工智能 计算与语言

摘要

检索增强生成(RAG)系统正日益成为鲁棒人工智能的核心, 通过引入外部知识来增强大语言模型(LLM)的可靠性。然而,我们的研究揭示了一个被严重忽视的关键漏洞:其对细微符号扰动极其敏感,尤其是通过近乎不可感知的表情符号标记(如"(@_@)")即可导致检索被误导,称为EmoRAG。我们展示,注入单个表情符号后,几乎100%的概率会检索到包含匹配表情符号的语义无关文本。我们在通用问答和代码领域进行了广泛实验,使用多种最先进的检索器和生成器,发现了三个关键发现:(I)单表情符号灾难:最小表情符号注入导致最大干扰,单个表情符号几乎100%主导RAG输出。(II)位置敏感性:在查询开头插入表情符号可导致严重扰动,所有数据集的F1分数均超过0.92。(III)参数规模脆弱性:令人反讽的是,参数更大的模型对这种干扰更脆弱。我们提供深入分析以揭示这些现象的底层机制。此外,我们提出了关于当前RAG系统鲁棒性假设的严重关切,构想了潜在攻击者利用此漏洞操控RAG系统的威胁情景。我们评估了标准防御措施,发现其对EmoRAG不足。为此,我们提出了针对性的防御措施,分析了其在缓解表情符号扰动方面的优势和局限性。最后,我们勾勒了构建鲁棒RAG系统的未来方向。

关键词

引用

@article{arxiv.2512.01335,
  title  = {EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations},
  author = {Xinyun Zhou and Xinfeng Li and Yinan Peng and Ming Xu and Xuanwang Zhang and Miao Yu and Yidong Wang and Xiaojun Jia and Kun Wang and Qingsong Wen and XiaoFeng Wang and Wei Dong},
  journal= {arXiv preprint arXiv:2512.01335},
  year   = {2025}
}

备注

Accepted to ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD) 2026