强化学习从人类反馈中的治理挑战:评估者理性与强化稳定性
计算机与社会
2025-04-22 v1 人工智能
摘要
从人类反馈进行的强化学习(RLHF)是大型语言模型(LLM)与人类价值观和期望相匹配的核心方法,但该过程仍面临评估者偏见、不一致性以及反馈可靠性不足等治理挑战。本研究考察了评估者认知能力——即其理性水平——对强化信号稳定性的影响。通过对比高理性与低理性参与者的控制实验,发现理性得分更高的评估者会产生更一致且更符合专家导向的反馈;而低理性参与者则表现出显著的强化决策变异性()。为应对这些挑战并提升RLHF治理效果,本文建议实施评估者预筛选、系统性审查反馈一致性以及可靠性加权的强化聚合。这些措施有助于提升AI对齐管道的公平性、透明度和鲁棒性。
引用
@article{arxiv.2504.13972,
title = {Governance Challenges in Reinforcement Learning from Human Feedback: Evaluator Rationality and Reinforcement Stability},
author = {Dana Alsagheer and Abdulrahman Kamal and Mohammad Kamal and Weidong Shi},
journal= {arXiv preprint arXiv:2504.13972},
year = {2025}
}