有限观测下的零样本动作泛化
机器学习
2025-03-13 v1 人工智能
计算机视觉与模式识别
摘要
强化学习 (RL) 在解决序贯决策问题方面展现出了显著的成功。然而,在现实场景中,当 RL 智能体面临训练期间未遇到过的未见动作时,往往难以泛化。先前一些关于零样本动作泛化的工作依赖于大量的动作观测数据集来捕捉新动作的行为,这使得它们在现实应用中不切实际。在本文中,我们引入了一种新颖的零样本框架,即有限观测下的动作泛化 (AGLO)。我们的框架有两个主要组件:动作表示学习模块和策略学习模块。动作表示学习模块从有限的观测中提取动作的判别性嵌入,而策略学习模块利用学习到的动作表示以及增强的合成动作表示,来学习能够处理具有未见动作任务的策略。实验结果表明,我们的框架在多个基准任务上的零样本动作泛化方面显著优于 SOTA 方法,展示了其在以最少动作观测泛化到新动作上的有效性。
引用
@article{arxiv.2503.08867,
title = {Zero-Shot Action Generalization with Limited Observations},
author = {Abdullah Alchihabi and Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2503.08867},
year = {2025}
}
备注
AISTATS 2025