中文

非自然错误纠正:GPT-4 几乎可完美处理非自然乱序文本

计算与语言 2023-12-01 v1 人工智能

摘要

尽管大语言模型(LLM)在许多任务上取得了卓越表现,其内在工作机制仍不甚明晰。在本研究中,我们针对 LLM(尤其是 GPT-4)在经历广泛字符级置换时的鲁棒性提出了新颖的实验洞察。为此,我们首先提出 Scrambled Bench,一套用于衡量 LLM 处理乱序输入能力的测试套件,涵盖恢复乱序句子与基于乱序上下文回答问题两方面。实验结果表明,大多数强大的 LLM 展现出类似“字位错乱容忍”(typoglycemia)的能力——即人类在词内字母乱序但首末字母不变时仍能理解词义的现象。更令人惊讶的是,我们发现仅 GPT-4 能近乎无瑕地处理带非自然错误的输入,即便在极端条件下亦如此,该任务对其他 LLM 乃至人类都构成重大挑战。具体而言,即便每个词内所有字母完全乱序,GPT-4 仍能几乎完美地从乱序句重建原句,将编辑距离降低 95%。尽管乱序文本严重破坏了输入分词,LLM 却能展现如此鲁棒性,这有悖直觉。

关键词

引用

@article{arxiv.2311.18805,
  title  = {Unnatural Error Correction: GPT-4 Can Almost Perfectly Handle Unnatural Scrambled Text},
  author = {Qi Cao and Takeshi Kojima and Yutaka Matsuo and Yusuke Iwasawa},
  journal= {arXiv preprint arXiv:2311.18805},
  year   = {2023}
}

备注

EMNLP 2023 (with an additional analysis section in appendix)