中文

LLM 对垂直对齐文本操纵的脆弱性

计算与语言 2025-09-29 v4

摘要

垂直文本输入在各种实际应用中很常见,例如数学计算和基于单词的数独谜题。尽管当前的大型语言模型(LLMs)在自然语言任务中表现出色,但它们仍然容易受到文本格式变化的影响。最近的研究表明,修改输入格式(例如为基于编码器的模型垂直对齐单词)会大幅降低文本分类任务的准确率。尽管人类很容易理解这些输入,但它们可能会严重误导模型,在实际场景中构成绕过有害或敏感信息检测的潜在风险。随着 LLMs 应用的不断扩展,出现了一个关键问题:基于解码器的 LLMs 是否对垂直格式的文本输入表现出类似的脆弱性?在本文中,我们研究了垂直文本输入对各种 LLMs 在多个文本分类数据集上性能的影响,并分析了其潜在原因。我们的发现如下:(i)垂直文本输入显著降低了 LLMs 在文本分类任务中的准确率。(ii)思维链(CoT)推理无助于 LLMs 识别垂直输入或减轻其脆弱性,但经过仔细分析的少样本学习可以做到。(iii)我们通过分析分词和注意力矩阵中的固有问题,探讨了这种脆弱性的潜在原因。

关键词

引用

@article{arxiv.2410.20016,
  title  = {Vulnerability of LLMs to Vertically Aligned Text Manipulations},
  author = {Zhecheng Li and Yiwei Wang and Bryan Hooi and Yujun Cai and Zhen Xiong and Nanyun Peng and Kai-wei Chang},
  journal= {arXiv preprint arXiv:2410.20016},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main)