电路感知奖励训练:RLHF中长尾鲁棒性的机制框架
机器学习
2025-09-30 v1 人工智能
摘要
基于人类反馈的强化学习(RLHF)奖励模型在长尾分布上表现出系统性失败,导致奖励黑客和不对齐。我们提出了一个机制可解释性框架,用于识别奖励模型中负责罕见事件处理的专门神经回路。借鉴近期关于语言模型中罕见token分布式专业化的进展\citep{liu2025no, liu2025emergent},我们假设奖励模型也会为长尾场景发展出功能上截然不同的回路。我们的理论框架在回路专业化、奖励泛化界限和长尾性能之间建立了正式联系。我们引入了\textbf{电路感知奖励训练(CART)},它使用回路分析来指导数据增强、正则化和集成策略。该方法既提供了对奖励模型失败的理论洞察,也提供了提高长尾鲁棒性的实际干预措施。
引用
@article{arxiv.2509.24713,
title = {Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF},
author = {Jing Liu},
journal= {arXiv preprint arXiv:2509.24713},
year = {2025}
}