中文

面向神经反馈的强化学习: 将fNIRS信号映射到智能体性能

人工智能 2026-02-10 v4 机器学习

摘要

从人类反馈进行的强化学习(RLHF)是一种通过整合用户反馈来实现智能体行为与人类偏好一致的方法。本文引入一种框架,通过潜在神经信号引导智能体训练,特别关注神经分类问题。我们的工作提出并公开了一套新型功能近红外光谱(fNIRS)记录数据集,来自25名来自三个领域的受试者:抓取-放置机器人、月球着陆和Flappy Bird游戏。我们训练多个分类器,从预处理后的fNIRS特征窗口中预测不同程度的智能体性能(最优、次优或最差),在不同条件和领域下实现67%的二分类F1分数和46%的多分类F1分数。我们还训练了多个回归器,用于预测智能体所选动作与一组近最优策略动作之间的偏差程度,提供连续的性能度量。最后,我们评估了跨受试者的泛化情况,表明通过对预训练模型进行细调并使用少量受试者特定数据,可使二分类和多分类模型的平均F1分数分别提高17%和41%。我们的结果表明,将潜在fNIRS信号映射到智能体性能是可行的,并且可以得到改进,为未来的强化学习神经反馈(RLNF)系统奠定了基础。

关键词

引用

@article{arxiv.2511.12844,
  title  = {Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance},
  author = {Julia Santaniello and Matthew Russell and Benson Jiang and Donatello Sassaroli and Robert Jacob and Jivko Sinapov},
  journal= {arXiv preprint arXiv:2511.12844},
  year   = {2026}
}

备注

Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings