InvThink:用于更安全的语言模型的预灾难推理
人工智能
2026-05-11 v3 计算与语言
摘要
我们提出 InvThink,一种需要模型在生成最终响应前枚举、分析并约束潜在失败的训练和提示框架。不同于现有的安全对齐方法仅优化安全最终响应之外的做法,InvThink 将生成结构化为三个步骤:(1) 枚举潜在危害;(2) 分析其后果;(3) 在明确的缓解约束下生成响应。我们观察到三个发现:(i) 在更大的模型规模上,InvThink 在安全评分方面高于现有的安全提示和对齐基线方法。(ii) InvThink 缓解了安全税。使用 INVTHINK 训练的模型在标准基准测试中保留了其推理能力。(iii) 除了一般安全任务外,InvThink 还在专业伦理领域(医疗、金融、法律)以及代理人不匹配情境中减少有害行为,相较于零样本基线实现最高可达 32% 的有害性降低,相较于 SafetyPrompt 实现 16% 的降低。我们将 InvThink 扩展于监督微调,并基于 GRPO 的强化学习跨越三个 LLM 系列。
引用
@article{arxiv.2510.01569,
title = {InvThink: Premortem Reasoning for Safer Language Models},
author = {Yubin Kim and Taehan Kim and Eugene Park and Chunjong Park and Cynthia Breazeal and Daniel McDuff and Hae Won Park},
journal= {arXiv preprint arXiv:2510.01569},
year = {2026}
}