最大因果Tsallis熵模仿学习
机器学习
2018-05-29 v2 机器学习
摘要
本文提出了一种新颖的最大因果Tsallis熵(MCTE)模仿学习框架,能够从演示中高效学习稀疏多模态策略分布。我们给出了所提框架的完整数学分析。首先,MCTE问题的最优解被证明为sparsemax分布,其支撑集可调整。所提方法相较于softmax分布具有优势,因为它可通过赋予零概率来排除不必要的动作。其次,我们证明了MCTE问题在Brier分数意义下等价于鲁棒贝叶斯估计。第三,我们提出了一种采用稀疏混合密度网络(sparse MDN)的最大因果Tsallis熵模仿学习(MCTEIL)算法,通过使用sparsemax分布对混合权重建模。特别地,我们表明MDN的因果Tsallis熵鼓励探索与高效的混合利用,而Boltzmann Gibbs熵效果较差。我们在两项仿真研究中验证了所提方法,MCTEIL在平均回报和学习多模态策略方面优于现有模仿学习方法。
引用
@article{arxiv.1805.08336,
title = {Maximum Causal Tsallis Entropy Imitation Learning},
author = {Kyungjae Lee and Sungjoon Choi and Songhwai Oh},
journal= {arXiv preprint arXiv:1805.08336},
year = {2018}
}