中文

电路感知奖励训练:RLHF中长尾鲁棒性的机制框架

机器学习 2025-09-30 v1 人工智能

摘要

基于人类反馈的强化学习(RLHF)奖励模型在长尾分布上表现出系统性失败,导致奖励黑客和不对齐。我们提出了一个机制可解释性框架,用于识别奖励模型中负责罕见事件处理的专门神经回路。借鉴近期关于语言模型中罕见token分布式专业化的进展\citep{liu2025no, liu2025emergent},我们假设奖励模型也会为长尾场景发展出功能上截然不同的回路。我们的理论框架在回路专业化、奖励泛化界限和长尾性能之间建立了正式联系。我们引入了\textbf{电路感知奖励训练(CART)},它使用回路分析来指导数据增强、正则化和集成策略。该方法既提供了对奖励模型失败的理论洞察,也提供了提高长尾鲁棒性的实际干预措施。

关键词

引用

@article{arxiv.2509.24713,
  title  = {Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF},
  author = {Jing Liu},
  journal= {arXiv preprint arXiv:2509.24713},
  year   = {2025}
}