中文

对思维链推理的先发制人式答案“攻击”

计算与语言 2024-06-03 v1 人工智能 密码学与安全

摘要

大型语言模型(LLM)在与思维链(CoT)提示相结合时展示了令人印象深刻的推理能力。然而,这种方法的鲁棒性有待进一步研究。在本文中,我们引入了一种称为先发制人式答案的新场景,其中LLM在进行推理之前就获得了答案。这种情况可能无意中发生,也可能由恶意用户通过提示注入攻击诱发。实验表明,在各种CoT方法和广泛的数据集上,先发制人式答案显著削弱了模型的推理能力。为了增强推理的鲁棒性,我们提出了两种措施,在一定程度上缓解了这个问题。

关键词

引用

@article{arxiv.2405.20902,
  title  = {Preemptive Answer "Attacks" on Chain-of-Thought Reasoning},
  author = {Rongwu Xu and Zehan Qi and Wei Xu},
  journal= {arXiv preprint arXiv:2405.20902},
  year   = {2024}
}

备注

Accepted to ACL'24 (Findings). Camera-ready version