中文

利用程序化风格一致性学习可校准策略

机器学习 2020-07-17 v3 机器学习

摘要

我们研究长时序序列行为可控生成的问题,其目标是同时校准到多种行为风格。与已被充分研究的图像、文本和语音可控生成领域不同,在生成长时序行为时有两个问题带来显著挑战:我们应如何指定待控制的变异因素,以及我们如何确保所生成的行为忠实地展现组合意义上的多种风格?我们利用程序化标注函数指定可控风格,并推导出风格一致性的形式化概念作为学习目标,该目标随后可使用常规策略学习方法求解。我们使用来自职业篮球运动员和 MuJoCo 物理环境中智能体的示范来评估我们的框架,并表明现有未显式强制风格一致性的方法无法生成多样行为,而我们学习的策略可针对多达 1024 种不同风格组合进行校准。

关键词

引用

@article{arxiv.1910.01179,
  title  = {Learning Calibratable Policies using Programmatic Style-Consistency},
  author = {Eric Zhan and Albert Tseng and Yisong Yue and Adith Swaminathan and Matthew Hausknecht},
  journal= {arXiv preprint arXiv:1910.01179},
  year   = {2020}
}