基于点互信息加权的多样化策略恢复
机器学习
2024-10-23 v2 人工智能
机器学习
摘要
从一组专家轨迹中恢复多样化策略是仿照学习中的一个重要研究主题。在确定轨迹的潜在风格后,先前的多样化策略恢复方法通常采用基于潜在风格的行为克隆学习目标,将轨迹中每个状态-动作对的重要性视为相等。基于在许多情景下,行为风格通常仅与状态-动作对的子集高度相关的观察,本文提出了一种新的原则方法来恢复多样化策略。具体而言,在推断或分配轨迹的潜在风格后,我们通过 incorporating 基于点互信息的加权机制来增强基本行为克隆。这种额外的加权反映了每个状态-动作对对学习该风格贡献的重要性,从而允许我们关注最能代表该风格的状态-动作对。我们对新目标提供了理论依据, extensive empirical 评估确认了我们方法在从专家数据中恢复多样化策略方面的有效性。
引用
@article{arxiv.2410.15910,
title = {Diverse Policies Recovering via Pointwise Mutual Information Weighted Imitation Learning},
author = {Hanlin Yang and Jian Yao and Weiming Liu and Qing Wang and Hanmin Qin and Hansheng Kong and Kirk Tang and Jiechao Xiong and Chao Yu and Kai Li and Junliang Xing and Hongwu Chen and Juchao Zhuo and Qiang Fu and Yang Wei and Haobo Fu},
journal= {arXiv preprint arXiv:2410.15910},
year = {2024}
}
备注
18 pages, 6 figures