中文

更安全的推理轨迹:衡量与缓解 LLM 中的链式思考泄漏

计算与语言 2026-03-09 v1

摘要

链式思考 (CoT) 提示可提升 LLM 的推理能力,但可能通过在推理轨迹和输出中复现提示中的个人可识别信息 (PII) 增加隐私风险,即便遵循指示模型不要复述 PII 的政策。我们使用一种模型中性框架研究此类直接、推理时 PII 泄漏:(i) 将泄漏定义为跨 11 种 PII 类型的所有风险加权、token 级事件,(ii) 随允许的 CoT 预算绘制泄漏曲线,(iii) 在结构化 PII 数据集上比较开源与闭源模型家族。我们发现 CoT 在高风险类别中持续放大泄漏,泄漏随模型家族和预算强相关。增加推理预算可能放大或削弱泄漏,取决于基模型。随后我们基准测试轻量级推理时门控器:基于规则的检测器、TF-IDF + logistic 回归分类器、GLiNER 基于 NER 模型以及 LLM 作为判官。没有单一方法在所有模型或预算下均占优势,动机在常见可重复协议下采用混合、风格自适应的门控政策,以平衡实用性与风险。

关键词

引用

@article{arxiv.2603.05618,
  title  = {Safer Reasoning Traces: Measuring and Mitigating Chain-of-Thought Leakage in LLMs},
  author = {Patrick Ahrend and Tobias Eder and Xiyang Yang and Zhiyi Pan and Georg Groh},
  journal= {arXiv preprint arXiv:2603.05618},
  year   = {2026}
}