通过轨迹分割进行指令跟随策略的数据增强
机器学习
2025-03-05 v1 人工智能
机器人学
摘要
机器人或游戏领域中可指令智能体的可扩展性常常受到将指令与智能体轨迹配对的数据有限的阻碍。然而,包含各种智能体行为序列(游戏轨迹)的大规模未标注轨迹数据集通常是可用的。在半监督设置中,我们探索了从游戏轨迹中提取带标签片段的方法。目标是增强一个小型带标注的指令-轨迹对数据集,以提高通过下游模仿学习训练的指令跟随策略的性能。假设片段长度变化很小,最近的视频分割方法可以有效地提取带标签的片段。为了解决片段长度的约束,我们提出了游戏分割(PS),一种概率模型,它仅针对单个指令片段进行训练,却能找到扩展子片段的最大似然分割。我们在游戏环境和模拟机器人夹爪设置中的结果强调了分割的重要性;随机采样的片段会降低性能,而纳入来自PS的带标签片段可将策略性能提升到使用两倍带标签数据训练的策略水平。
引用
@article{arxiv.2503.01871,
title = {Data Augmentation for Instruction Following Policies via Trajectory Segmentation},
author = {Niklas Höpner and Ilaria Tiddi and Herke van Hoof},
journal= {arXiv preprint arXiv:2503.01871},
year = {2025}
}