推理痕迹的信息保留式改写以实现反蒸馏
计算与语言
2025-10-14 v1
摘要
最近的进展表明,延长推理链的长度显著提高了在复杂任务上的性能。虽然揭示这些推理痕迹有助于用户更好地遵循、验证和学习模型的解决问题过程,但这也使其高度易受到未经授权的蒸馏攻击。为缓解这一风险,专有模型提供商通常采用激进的保护策略,如用简短的摘要替换详细的推理,从而剥夺了用户宝贵的中间信息。为此,我们提出了 PART,一种信息保留式反蒸馏推理痕迹改写方法。灵感来自人类理解推理痕迹方式与 LLM 将其用于监督式微调方式之间的差异,我们设计了一种简单有效的两步改写:移除自我交谈行为并重新排序子结论。训练一个小型辅助模型执行此改写,计算开销最小。大量实验表明,PART 在各种推理基准上 consistently 破坏蒸馏,适用于不同规模和类型的学生模型。例如,在改写后的痕迹上进行训练时,一个规模为 32B 的大型学生模型在 AIME 2024 上的性能从 54.17 下降到 46.88,相当于 13.5% 的性能下降。
引用
@article{arxiv.2510.11545,
title = {Information-Preserving Reformulation of Reasoning Traces for Antidistillation},
author = {Jiayu Ding and Lei Cui and Li Dong and Nanning Zheng and Furu Wei},
journal= {arXiv preprint arXiv:2510.11545},
year = {2025}
}