中文

强化学习从人类反馈中的治理挑战:评估者理性与强化稳定性

计算机与社会 2025-04-22 v1 人工智能

摘要

从人类反馈进行的强化学习(RLHF)是大型语言模型(LLM)与人类价值观和期望相匹配的核心方法,但该过程仍面临评估者偏见、不一致性以及反馈可靠性不足等治理挑战。本研究考察了评估者认知能力——即其理性水平——对强化信号稳定性的影响。通过对比高理性与低理性参与者的控制实验,发现理性得分更高的评估者会产生更一致且更符合专家导向的反馈;而低理性参与者则表现出显著的强化决策变异性(p<0.01p < 0.01)。为应对这些挑战并提升RLHF治理效果,本文建议实施评估者预筛选、系统性审查反馈一致性以及可靠性加权的强化聚合。这些措施有助于提升AI对齐管道的公平性、透明度和鲁棒性。

关键词

引用

@article{arxiv.2504.13972,
  title  = {Governance Challenges in Reinforcement Learning from Human Feedback: Evaluator Rationality and Reinforcement Stability},
  author = {Dana Alsagheer and Abdulrahman Kamal and Mohammad Kamal and Weidong Shi},
  journal= {arXiv preprint arXiv:2504.13972},
  year   = {2025}
}