中文

思维链推理真的能减少越狱攻击的危害吗?

人工智能 2025-05-26 v1

摘要

已有研究表明,越狱攻击在很大程度上对近期通过思维链(Chain-of-Thought, CoT)推理增强的推理模型失效。然而,其潜在机制仍未被充分探索,且仅依赖推理能力可能引发安全担忧。在本文中,我们尝试回答这个问题:CoT推理真的能减少越狱攻击的危害吗?通过严格的理论分析,我们证明了CoT推理对越狱危害具有双重效应。基于理论洞察,我们提出了一种新型越狱方法FicDetail,其实际性能验证了我们的理论发现。

关键词

引用

@article{arxiv.2505.17650,
  title  = {Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?},
  author = {Chengda Lu and Xiaoyu Fan and Yu Huang and Rongwu Xu and Jijie Li and Wei Xu},
  journal= {arXiv preprint arXiv:2505.17650},
  year   = {2025}
}