中文

微型奖励模型

计算与语言 2025-07-15 v1 人工智能

摘要

大型基于解码器的语言模型已成为强化学习从人类反馈 (RLHF) 中进行奖励建模的主导架构。然而,随着奖励模型在测试时策略中的部署增多,其推理成本日益成为关注焦点。我们提出TinyRM,一套规模小巧的双向掩码语言模型 family,参数数量仅需约4亿,即可在推理和安全偏好建模任务上与规模超过175倍的模型媲美。TinyRM 结合了 FLAN 风格的提示、Directional Low-Rank Adaptation (DoRA) 以及层冻结技术,虽然资源消耗显著降低,却在 RewardBench 上实现强劲性能。我们的实验表明,小模型在特定领域调优方面受益尤明显,尤其是在推理领域,轻量级微调方法尤为有效。尽管在构建通用模型和对话偏好建模方面仍存在挑战,但我们的初步结果凸显了轻量级双向架构作为高效、可扩展的偏好建模替代方案的前景。

关键词

引用

@article{arxiv.2507.09973,
  title  = {Tiny Reward Models},
  author = {Sarah Pan},
  journal= {arXiv preprint arXiv:2507.09973},
  year   = {2025}
}

备注

2025 ICML Efficient Systems for Foundation Models Workshop