面向线性马尔可夫决策过程的无视程 regret 界
计算机视觉与模式识别
2024-03-19 v1
摘要
最近的研究表明,强化学习 (RL) 中的 regret 界可以(近乎)独立于规划视程,这称为 horizon-free 界。然而,这些 regret 界仅适用于允许对转换模型大小多项式依赖的设置,例如表格型马尔可夫决策过程 (MDP) 和线性混合 MDP。我们给出面向流行的线性 MDP 设置的第一个 horizon-free 界,其中转换模型的大小可能呈指数级或甚至是不可数。与先前方法不同,这些方法会显式估计转换模型并计算不同时间步的非均匀价值函数,我们直接估计价值函数和置信集合。通过:(1)维护多个加权最小二乘估计器用于价值函数;以及(2)表明非均匀价值函数的最大总变差被特征维度的多项式因子所界定的结构引理来获得 horizon-free 界。
引用
@article{arxiv.2403.10737,
title = {Leveraging Synthetic Data for Generalizable and Fair Facial Action Unit Detection},
author = {Liupei Lu and Yufeng Yin and Yuming Gu and Yizhen Wu and Pratusha Prasad and Yajie Zhao and Mohammad Soleymani},
journal= {arXiv preprint arXiv:2403.10737},
year = {2024}
}
备注
The work was done in 2021