手写笔迹的奖励是什么?——基于模仿学习的手写生成
计算机视觉与模式识别
2020-09-24 v1
摘要
分析手写生成过程是一个重要问题,已得到多种生成模型的探讨,例如基于运动学的模型和随机模型。在本研究中,我们采用强化学习(RL)框架来实现具备谨慎未来规划能力的手写生成。事实上,人类的书写过程同样依赖于其未来规划能力;例如,要生成像“0”这样的闭合轨迹就必须具备该能力,因为任何短视模型(如马尔可夫模型)都无法生成它。在算法上,我们采用生成对抗模仿学习(GAIL)。典型的RL算法需要人工定义奖励函数,而该函数对控制生成过程至关重要。相比之下,GAIL在训练框架其他模块的同时训练奖励函数。换言之,通过GAIL,我们可以从手写样本中理解手写生成过程的奖励。我们的实验结果从定性和定量两方面表明,学习到的奖励捕捉到了手写生成的趋势,因此GAIL非常适合于手写行为的习得。
引用
@article{arxiv.2009.10962,
title = {What is the Reward for Handwriting? -- Handwriting Generation by Imitation Learning},
author = {Keisuke Kanda and Brian Kenji Iwana and Seiichi Uchida},
journal= {arXiv preprint arXiv:2009.10962},
year = {2020}
}
备注
Accepted at ICFHR2020