引导LLM欺骗自身:自动操纵机器阅读理解捷径触发器
计算与语言
2023-10-31 v1 人工智能
摘要
近期LLM在机器阅读理解(MRC)系统中的应用取得了令人印象深刻的成果,但捷径(由与真实标签虚假相关的特征触发机制)的使用已成为对其可靠性的潜在威胁。我们从两个角度分析问题:LLM作为编辑者,被引导编辑文本以误导LLM;以及LLM作为阅读者,基于被编辑文本回答问题。我们提出一个引导编辑者为样本添加潜在捷径触发器的框架。使用GPT4作为编辑者,我们发现其能成功编辑样本中的捷径触发器以欺骗LLM。分析作为阅读者的LLM,我们观察到即便能力强的LLM也会因捷径知识被欺骗。引人注目的是,我们发现GPT4可被其自身的编辑欺骗(F1下降15%)。我们的发现凸显了LLM对捷径操纵的固有脆弱性。我们发布了ShortcutQA,一个由我们的框架生成的精选数据集,供未来研究使用。
引用
@article{arxiv.2310.18360,
title = {Guiding LLM to Fool Itself: Automatically Manipulating Machine Reading Comprehension Shortcut Triggers},
author = {Mosh Levy and Shauli Ravfogel and Yoav Goldberg},
journal= {arXiv preprint arXiv:2310.18360},
year = {2023}
}
备注
Accepted to EMNLP 2023 Findings