中文

引导LLM欺骗自身:自动操纵机器阅读理解捷径触发器

计算与语言 2023-10-31 v1 人工智能

摘要

近期LLM在机器阅读理解(MRC)系统中的应用取得了令人印象深刻的成果,但捷径(由与真实标签虚假相关的特征触发机制)的使用已成为对其可靠性的潜在威胁。我们从两个角度分析问题:LLM作为编辑者,被引导编辑文本以误导LLM;以及LLM作为阅读者,基于被编辑文本回答问题。我们提出一个引导编辑者为样本添加潜在捷径触发器的框架。使用GPT4作为编辑者,我们发现其能成功编辑样本中的捷径触发器以欺骗LLM。分析作为阅读者的LLM,我们观察到即便能力强的LLM也会因捷径知识被欺骗。引人注目的是,我们发现GPT4可被其自身的编辑欺骗(F1下降15%)。我们的发现凸显了LLM对捷径操纵的固有脆弱性。我们发布了ShortcutQA,一个由我们的框架生成的精选数据集,供未来研究使用。

关键词

引用

@article{arxiv.2310.18360,
  title  = {Guiding LLM to Fool Itself: Automatically Manipulating Machine Reading Comprehension Shortcut Triggers},
  author = {Mosh Levy and Shauli Ravfogel and Yoav Goldberg},
  journal= {arXiv preprint arXiv:2310.18360},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 Findings