中文

大语言模型对对抗性排版错误的推理鲁棒性

计算与语言 2024-11-11 v1 人工智能

摘要

大语言模型(LLMs)在利用思维链(CoT)提示进行推理方面已展现出令人印象深刻的能力。然而,CoT 可能会受到用户指令的偏差。在本工作中,我们研究了大语言模型对排版错误的推理鲁棒性,排版错误可自然出现在用户查询中。我们设计了一种对抗性拼写攻击(ATA)算法,该算法迭代地为对查询重要的单词采样拼写错误,并选择最有可能成功攻击的编辑。实验表明,大语言模型对最小的对抗性排版变化非常敏感。值得注意的是,在 GSM8K 上,Mistral-7B-Instruct 的准确率在 1 个字符编辑时从 43.7% 下降到 38.6%,而在 8 个字符编辑时进一步下降到 19.2%。为了将我们的评估扩展到更大且闭源的大语言模型,我们开发了 R2ATA\texttt{R}^2\texttt{ATA} 基准,用于评估模型的推理鲁棒性对 ATA 的表现。它包括通过对开源大语言模型应用 ATA 从三个广泛使用的推理数据集——GSM8K、BBH 和 MMLU——派生的对抗性排版问题。R2ATA\texttt{R}^2\texttt{ATA} 展现了显著的迁移性,并在多个超大规模闭源大语言模型上导致了显著的性能下降。

关键词

引用

@article{arxiv.2411.05345,
  title  = {Reasoning Robustness of LLMs to Adversarial Typographical Errors},
  author = {Esther Gan and Yiran Zhao and Liying Cheng and Yancan Mao and Anirudh Goyal and Kenji Kawaguchi and Min-Yen Kan and Michael Shieh},
  journal= {arXiv preprint arXiv:2411.05345},
  year   = {2024}
}