通过关键表示微调增强链式思维推理
计算与语言
2025-07-15 v1 人工智能
摘要
表示微调 (ReFT) 作为一种近期提出的参数高效微调 (PEFT) 方法,因仅通过编辑表示空间即可显著提升参数效率而引起广泛关注。本文探讨将 ReFT 应用于复杂推理任务的可能性。然而,直接使用原生 ReFT 方法进行微调——该方法在每层的开头和结尾处修改固定表示——会产生次优性能,因为这些固定位置的表示对输出影响不确定。我们观察到,在复杂推理任务中,通常存在某些关键表示。这类表示要么整合了来自前几层的大量信息,要么调节后续层的表示。通过逐层传播,这些表示对最终输出产生显著影响。因此,对这些关键表示进行微调有望显著提升推理性能。基于这些见解,我们提出了关键表示微调 (CRFT),一种新方法,通过信息流分析识别和优化这些关键表示。CRFT 在监督学习框架下运行,动态地在低秩线性子空间中优化关键表示,同时冻结基础模型。我们在八个算术和常识推理基准测试中验证了该方法的有效性和效率,测试对象包括 LLaMA 和 Mistral 模型系列。此外,该方法在零样本设置下也能有效应用,将零样本准确率提升 16.4%。我们的工作凸显了针对链式思维推理的表示级优化的潜在价值,为传统 PEFT 方法提供了一种轻量且强大的替代方案。
引用
@article{arxiv.2507.10085,
title = {Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning},
author = {Chenxi Huang and Shaotian Yan and Liang Xie and Binbin Lin and Sinan Fan and Yue Xin and Deng Cai and Chen Shen and Jieping Ye},
journal= {arXiv preprint arXiv:2507.10085},
year = {2025}
}
备注
Accepted by ACL 2025