Resa:通过稀疏自编码器实现透明推理模型
计算与语言
2025-06-17 v2 人工智能
机器学习
摘要
我们如何通过利用语言模型的内部表示来经济高效地激发其强大的推理能力?我们通过Resa回答了这个问题,这是一个通过一种新颖且高效的稀疏自编码器调优(SAE-Tuning)程序训练的1.5B推理模型家族。该方法首先训练一个稀疏自编码器以从源模型中捕获推理能力,然后利用训练好的稀疏自编码器引导标准监督微调过程,以在目标模型中激发此类推理能力,全部使用经过验证的问答数据而无需任何推理轨迹。值得注意的是,当应用于某些基础模型并在进一步的RL后训练之前时,SAE-Tuning保留了其RL训练对应模型超过97%的推理性能,同时将训练成本降低了超过2000倍至约1美元,将训练时间降低了超过450倍至约20分钟。此外,当应用于轻度RL训练的模型(例如在2个GPU上训练1小时内)时,它仅需约1美元的额外成本即可实现43.33%的AIME24 Pass@1和90%的AMC23 Pass@1推理性能。令人惊讶的是,通过稀疏自编码器提取的推理能力可能既具有通用性又具有模块化。通用性意味着从一个数据集提取的能力仍可提升在更大且重叠语料上的性能。模块化意味着从Qwen或Qwen-Math提取的能力可以在测试时附加到R1-Distill模型上,无需任何重新训练,并产生可比的提升。广泛的消融实验验证了这些发现,且所有模型权重均已完全开源。
引用
@article{arxiv.2506.09967,
title = {Resa: Transparent Reasoning Models via SAEs},
author = {Shangshang Wang and Julian Asilis and Ömer Faruk Akgül and Enes Burak Bilgin and Ollie Liu and Deqing Fu and Willie Neiswanger},
journal= {arXiv preprint arXiv:2506.09967},
year = {2025}
}