中文

可控推理模型是隐私思考者

计算与语言 2026-03-02 v1 人工智能

摘要

由推理模型驱动的人工智能代理需要访问敏感的用户数据。然而,它们的推理轨迹难以控制,这可能导致私人信息意外泄露给外部方。我们提出训练模型不仅在最终答案中遵循指令,而且在推理轨迹中也遵循指令,可能在不同的约束条件下。我们假设,提高它们在推理轨迹中的指令遵循能力可以提升它们的隐私保护技能。为了证明这一点,我们在一个新的指令遵循数据集上微调模型,该数据集对推理轨迹有明确的限制。我们进一步引入了一种生成策略,该策略使用单独的 LoRA 适配器将推理和答案生成解耦。我们在来自两个模型家族的六个模型上评估了我们的方法,参数范围从 1.7B 到 14B,跨越两个指令遵循基准和两个隐私基准。我们的方法取得了显著的改进,在指令遵循性能上提升了高达 20.9 分,在隐私基准上提升了高达 51.9 个百分点。然而,由于推理性能与指令遵循能力之间的权衡,这些改进可能会以牺牲任务效用为代价。总的来说,我们的结果表明,改进推理模型中的指令遵循行为可以显著增强隐私,为未来开发隐私感知代理指明了一个有前景的方向。我们的代码和数据可在 https://github.com/UKPLab/arxiv2026-controllable-reasoning-models 获取。

关键词

引用

@article{arxiv.2602.24210,
  title  = {Controllable Reasoning Models Are Private Thinkers},
  author = {Haritz Puerto and Haonan Li and Xudong Han and Timothy Baldwin and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2602.24210},
  year   = {2026}
}