多教师学习中的保守偏差:为何智能体偏好低奖励教师
机器人学
2025-12-24 v2 人工智能
摘要
交互式强化学习(IRL)在使自动智能体和机器人从人类教师那里学习复杂行为方面取得了显著进展,但教师选择的动态仍鲜为人知。本文揭示了 IRL 中的一个意外现象:当给定教师之间的选择时,拥有不同奖励结构的教师,学习智能体几乎偏好保守的、低奖励教师(93.16% 选择率),而非提供 20 倍奖励的教师。通过在导航任务中进行 1,250 次实验运行,我们发现:(1)保守偏差主导教师选择:智能体系统选择最低奖励教师,优先考虑一致性而非最优性;(2)在教师可用性 rho >= 0.6 和准确率 omega >= 0.6 时存在关键性能阈值,低于这些阈值时,框架会出现灾难性失败;(3)在概念漂移下,该框架相对于基线 Q-learning 实现了 159% 的改进。这些发现挑战了关于 RL 中最优教学的基本假设,并提示人机协作可能的含义,在人类偏好安全和一致性方面可能与所观察到的智能体选择行为相吻合,从而为安全关键型机器人应用的训练范式提供指导。
关键词
引用
@article{arxiv.2512.17180,
title = {Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors},
author = {Maher Mesto and Francisco Cruz},
journal= {arXiv preprint arXiv:2512.17180},
year = {2025}
}
备注
10 pages, 5 figures. Accepted at ACRA 2025 (Australasian Conference on Robotics and Automation)