中文

认识因果影响的人类循环内反事实数据增强

机器学习 2024-12-13 v2 人工智能 机器人学

摘要

离线数据在教导机器人学习复杂行为方面既宝贵又实用。理想情况下,学习代理不应受限于可用演示的稀缺性,而应能够超越训练分布进行泛化。然而,现实场景的复杂性通常需要大量数据才能防止神经网络策略捕捉到虚假关联并学习非因果关系。我们提出了 CAIAC 方法,可在不访问在线环境交互的情况下从固定数据集创建可行的合成转换。通过利用量化因果影响的原则方法,我们能够通过在数据集中独立轨迹之间的状态空间中交换不受 action 影响的部分来进行反事实推理。我们实证表明,这导致对离线学习算法在分布迁移下的鲁棒性显著提升。

关键词

引用

@article{arxiv.2405.18917,
  title  = {Causal Action Influence Aware Counterfactual Data Augmentation},
  author = {Núria Armengol Urpí and Marco Bagatella and Marin Vlastelica and Georg Martius},
  journal= {arXiv preprint arXiv:2405.18917},
  year   = {2024}
}

备注

Accepted in 41st International Conference on Machine Learning (ICML 2024)