SFCoT:通过主动安全评估与校准实现更安全的链式思维
密码学与安全
2026-03-17 v1 人工智能
摘要
大语言模型(LLM)在复杂推理任务中展现出惊人能力,但仍高度易受越狱攻击威胁,其安全对齐受到挑战。现有防御机制通常仅针对最终输出应用事后过滤,未监控且暴露于中间推理步骤的风险。为填补这一空白,本文提出更安全链式思维(SFCoT)框架,主动实时评估并校准潜在不安全的推理步骤。SFCoT融入三层安全评分系统及多视角一致性验证机制,以检测推理过程中的潜在风险。动态干预模块随后执行针对性校准,将推理轨迹引导至安全结果。实验表明,SFCoT将攻击成功率从降至,证明其为有效且高效的LLM安全增强方法,未显著损害通用性能。
引用
@article{arxiv.2603.15397,
title = {SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration},
author = {Yu Pan and Wenlong Yu and Tiejun Wu and Xiaohu Ye and Qiannan Si and Guangquan Xu and Bin Wu},
journal= {arXiv preprint arXiv:2603.15397},
year = {2026}
}