CiPO:通过迭代偏好优化实现大规模推理模型的反事实忘却
计算与语言
2026-04-20 v1
摘要
机器忘却近年来日益受到关注,作为从大规模人类数据训练的大型语言模型中选择性移除不可接受隐私或版权信息的有前景技术。然而,大型推理模型(LRMs)的出现带来了困境:这些模型强调长链式思维(CoT)推理以解决复杂问题,现有方法要么难以完全消除 CoT 痕迹中的不可接受知识,要么因干扰推理过程而降低推理性能。为此,我们引入通过迭代偏好优化实现的反事实忘却(CiPO),一种新型框架,将忘却重新定义为针对 LRMs 中 CoT 推理的定向干预。具体而言,给定 desired 的忘却目标答案,CiPO 指示 LRMs 生成逻辑有效的反事实推理痕迹用于偏好调优。随着 LRM 对反事实痕迹的调整,CiPO 不断更新偏好学习数据以增加与原模型的差异。这种迭代循环确保可实现的忘却和平滑优化,有效缓解了困境。在具有挑战性的基准测试上进行的实验表明,CiPO 在忘却方面表现卓越,完整地从中间 CoT 步骤和最终答案中移除知识,同时保留了 LRMs 的推理能力。
引用
@article{arxiv.2604.15847,
title = {CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization},
author = {Junyi Li and Yongqiang Chen and Ningning Ding},
journal= {arXiv preprint arXiv:2604.15847},
year = {2026}
}
备注
Accepted by ACL 2026 Main Conference