中文

基于交叉注意力信号的自监督强化学习微调大语言模型方法

人工智能 2025-04-18 v2

摘要

我们提出了一种用于大语言模型后训练的新型强化学习框架,该框架不依赖人工在环反馈。相反,我们的方法利用模型内部的交叉注意力信号来推导自监督奖励,从而引导模型策略的迭代微调。通过分析模型在生成过程中对输入提示的关注方式,我们构建了提示覆盖率、聚焦度和连贯性的度量指标。随后利用这些指标对候选回答进行排序或评分,提供一个奖励信号,鼓励模型生成对齐良好、主题一致的文本。与标准策略梯度方法和基于合成偏好模型的 RL 微调进行实证对比后,我们的方法在提示相关性和一致性方面相比非 RL 基线取得了显著提升。虽然它尚未达到完全人工监督的 RLHF 系统的性能,但它凸显了以最少人工标注实现扩展对齐的重要方向。我们提供了详细分析,讨论了潜在局限,并概述了将基于交叉注意力的信号与少量人工反馈相结合的未来工作。

关键词

引用

@article{arxiv.2502.10482,
  title  = {A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals},
  author = {Andrew Kiruluta and Andreas Lemos and Priscilla Burity},
  journal= {arXiv preprint arXiv:2502.10482},
  year   = {2025}
}