基于结构风险最小化的逆强化学习模型选择
机器学习
2025-04-01 v2
摘要
逆强化学习(IRL)通常假设奖励函数模型被预先指定为特征的加权和,并且仅估计权重参数。然而,如何选择特征并确定合适的奖励模型并非易事,且依赖于经验。过于简单的模型不太可能包含理想的奖励函数,而高复杂度的模型则会导致大量的计算成本和潜在的过拟合。本文通过引入统计学习中的结构风险最小化(SRM)框架,解决了IRL问题中模型选择的这种权衡。SRM从假设集中选择一个最优的奖励函数类,同时最小化估计误差和模型复杂度。为了为IRL制定SRM方案,我们从给定的演示中估计策略梯度作为经验风险,并建立Rademacher复杂度的上界作为假设函数类的模型惩罚。进一步给出了SRM的学习保证。特别地,我们提供了线性加权和设置的显式形式。仿真实验展示了我们算法的性能和效率。
引用
@article{arxiv.2312.16566,
title = {Model Selection for Inverse Reinforcement Learning via Structural Risk Minimization},
author = {Chendi Qu and Jianping He and Xiaoming Duan and Jiming Chen},
journal= {arXiv preprint arXiv:2312.16566},
year = {2025}
}