胡言乱语:探究大语言模型对对抗性乱码输入的理解
计算与语言
2024-04-30 v2 人工智能
机器学习
摘要
大语言模型(LLMs)展现出理解人类语言的卓越能力,但它们是否也能理解对人类而言看似胡言乱语的自身语言?在这项工作中,我们深入探讨这一问题,旨在揭示LLMs中此类行为的内在机制。我们采用贪婪坐标梯度优化器来构造提示,迫使LLMs从看似无意义的输入中生成连贯的回复。我们将这些输入称为LM Babel,并系统地研究由这些提示操纵的LLMs的行为。我们发现,操纵效率取决于目标文本的长度和困惑度,且与自然提示相比,Babel提示通常位于更低的损失极小值处。我们进一步检查了Babel提示的结构并评估了其鲁棒性。值得注意的是,我们发现引导模型生成有害文本并不比引导其生成良性文本更困难,这表明在分布外提示方面存在对齐缺失。
引用
@article{arxiv.2404.17120,
title = {Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs},
author = {Valeriia Cherepanova and James Zou},
journal= {arXiv preprint arXiv:2404.17120},
year = {2024}
}