YFPO:面向数学推理的基于神经元引导奖励的联动特征偏好优化初步研究
计算与语言
2026-05-13 v1
摘要
偏好优化已成为提升大语言模型推理能力的重要后训练范式。现有方法通常依赖外部构建的偏好数据,使用偏好和非偏好响应作为样本级监督。然而,这种外部信号很少显式利用模型内部表征中包含的能力相关信息。对于数学推理,某些神经元组可能表现出与数学知识、符号操作或逻辑推理相关的激活模式。类似于反射性行为信号,这些内部激活可能粗略地指示模型是否正在调用数学相关能力。我们引入了 YFPO,即联动特征偏好优化(Yoked Feature Preference Optimization)的缩写,这是一个面向数学推理的初步的神经元引导偏好优化框架。YFPO 首先使用 AttnLRP 来识别与数学相关的神经元,然后根据这些神经元在偏好和非偏好响应之间的激活差异构建一个辅助奖励。这种设计用内部神经元级信号增强了外部偏好学习。我们使用 GSM8K 作为主要基准,在一个小规模语言模型上进行了初步实验。结果表明,神经元级信号可以与偏好优化相互作用,并偶尔提升推理性能,为更细粒度和可解释的面向推理的后训练提供了一个有前景的方向。
引用
@article{arxiv.2605.11906,
title = {YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning},
author = {Yifan Le},
journal= {arXiv preprint arXiv:2605.11906},
year = {2026}
}
备注
10 pages, 2figures. Work in progress