中文

SFCoT:通过主动安全评估与校准实现更安全的链式思维

密码学与安全 2026-03-17 v1 人工智能

摘要

大语言模型(LLM)在复杂推理任务中展现出惊人能力,但仍高度易受越狱攻击威胁,其安全对齐受到挑战。现有防御机制通常仅针对最终输出应用事后过滤,未监控且暴露于中间推理步骤的风险。为填补这一空白,本文提出更安全链式思维(SFCoT)框架,主动实时评估并校准潜在不安全的推理步骤。SFCoT融入三层安全评分系统及多视角一致性验证机制,以检测推理过程中的潜在风险。动态干预模块随后执行针对性校准,将推理轨迹引导至安全结果。实验表明,SFCoT将攻击成功率从58.97%58.97\%降至12.31%12.31\%,证明其为有效且高效的LLM安全增强方法,未显著损害通用性能。

关键词

引用

@article{arxiv.2603.15397,
  title  = {SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration},
  author = {Yu Pan and Wenlong Yu and Tiejun Wu and Xiaohu Ye and Qiannan Si and Guangquan Xu and Bin Wu},
  journal= {arXiv preprint arXiv:2603.15397},
  year   = {2026}
}