中文

如何在不输出推理痕迹的情况下窃取推理能力

系统与控制 2026-05-26 v2 系统与控制

摘要

许多大型语言模型(LLM)使用推理生成响应,但并不透露完整的推理痕迹(即思考链),仅输出最终答案和简短的推理摘要。为表明隐藏推理痕迹并不能防止用户“窃取”模型的推理能力,我们引入了 trace inversion models,这些模型仅给定输入、答案(以及可选的推理摘要)即可生成详细的、合成的推理痕迹。我们展示了(1)由 trace inversion 生成的痕迹与 ground-truth 推理痕迹之间具有高重叠度(当可用时),以及(2)在 inverted 痕迹上微调学生模型可显著提高其推理能力,并实现从专有的、黑盒 LLM 的蒸馏。

关键词

引用

@article{arxiv.2603.07266,
  title  = {Towards Network-Aware Operation of Integrated Energy Systems: A Comprehensive Review},
  author = {Alessandra Parisio},
  journal= {arXiv preprint arXiv:2603.07266},
  year   = {2026}
}

备注

23 pages, 6 figures, 2 tables. Includes IEEE preprint notice; network-aware IES survey; v2 fixes references