中文

胡言乱语:探究大语言模型对对抗性乱码输入的理解

计算与语言 2024-04-30 v2 人工智能 机器学习

摘要

大语言模型(LLMs)展现出理解人类语言的卓越能力,但它们是否也能理解对人类而言看似胡言乱语的自身语言?在这项工作中,我们深入探讨这一问题,旨在揭示LLMs中此类行为的内在机制。我们采用贪婪坐标梯度优化器来构造提示,迫使LLMs从看似无意义的输入中生成连贯的回复。我们将这些输入称为LM Babel,并系统地研究由这些提示操纵的LLMs的行为。我们发现,操纵效率取决于目标文本的长度和困惑度,且与自然提示相比,Babel提示通常位于更低的损失极小值处。我们进一步检查了Babel提示的结构并评估了其鲁棒性。值得注意的是,我们发现引导模型生成有害文本并不比引导其生成良性文本更困难,这表明在分布外提示方面存在对齐缺失。

关键词

引用

@article{arxiv.2404.17120,
  title  = {Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs},
  author = {Valeriia Cherepanova and James Zou},
  journal= {arXiv preprint arXiv:2404.17120},
  year   = {2024}
}