MERMAIDE:基于模型的元学习以对齐学习者
机器学习
2024-01-11 v2
摘要
我们研究委托人如何能够高效且有效地干预先前未见过的学习智能体的奖励,以诱导理想结果。这与拍卖或税收等许多现实场景相关,其中委托人可能不知道真实人类的学习行为及其奖励。此外,委托人应具备少样本适应能力并最小化干预次数,因为干预通常代价高昂。我们提出 MERMAIDE,一种基于模型的元学习框架,用于训练能够快速适配具有不同学习策略和奖励函数、分布外智能体的委托人。我们逐步验证该方法。首先,在具有最优响应智能体的 Stackelberg 设定中,我们展示元学习能够在测试时快速收敛到理论已知的 Stackelberg 均衡,尽管噪声观测严重增加了样本复杂度。随后我们展示我们基于模型的元学习方法在干预具有未见探索-利用策略的赌博机智能体时是具成本效益的。最后,在具有部分智能体信息的 -shot 和 -shot 设定中,我们的表现均优于仅使用元学习或仅使用智能体行为建模的基线。
引用
@article{arxiv.2304.04668,
title = {MERMAIDE: Learning to Align Learners using Model-Based Meta-Learning},
author = {Arundhati Banerjee and Soham Phade and Stefano Ermon and Stephan Zheng},
journal= {arXiv preprint arXiv:2304.04668},
year = {2024}
}
备注
Published in TMLR