基于隐式神经反馈的强化学习:面向人类对齐的机器人控制
机器人学
2025-12-02 v1 人工智能
摘要
传统的强化学习方法在奖励稀疏的情况下往往难以学习有效的策略,迫切需要手动设计复杂、任务特定的奖励函数。为此,强化学习从人类反馈(RLHF)已成为一种有前景的策略,补充手工设计的奖励。然而,大多数现有RLHF方法依赖于明确的反馈机制,如按钮按压或偏好标签,这些反馈机制会破坏自然的交互过程,并对用户造成巨大的认知负担。我们提出了一种新的强化学习从隐式人类反馈(RLIHF)框架,利用非侵入性脑电图(EEG)信号,具体为错误相关电位(ErrPs),提供持续的、无明确干预的反馈。该方法采用预训练的解码器将原始EEG信号转换为概率奖励组件,使代理即使在稀疏外部奖励存在时也能有效学习策略。我们在基于MuJoCo物理引擎构建的仿真环境中进行评估,使用Kinova Gen2机器人臂执行需要规避障碍物并操作目标物体的复杂抓取与放置任务。结果表明,使用解码EEG反馈训练的代理在性能上与使用稠密、人工设计奖励训练的代理相当。这些发现验证了利用隐式神经反馈实现可扩展且人类对齐的强化学习在交互式机器人中的潜力。
引用
@article{arxiv.2512.00050,
title = {Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control},
author = {Suzie Kim},
journal= {arXiv preprint arXiv:2512.00050},
year = {2025}
}
备注
Master's thesis, Korea University, 2025. arXiv admin note: substantial text overlap with arXiv:2507.13171