中文

LACMA:基于元动作语言对齐对比学习的具身指令跟随

计算与语言 2023-10-20 v1 计算机视觉与模式识别

摘要

端到端Transformer在训练所见环境中进行具身指令跟随(Embodied Instruction Following)时展现了令人印象深刻的成功率。然而,当部署于未见环境时,它们往往表现不佳。这种泛化能力的缺乏源于智能体对自然语言指令中细微变化的不敏感。为缓解此问题,我们提出通过对比学习显式地将智能体的隐藏状态与指令对齐。尽管如此,高层语言指令与智能体低层动作空间之间的语义鸿沟仍是一大障碍。因此,我们进一步引入元动作(meta-actions)这一新概念以弥合鸿沟。元动作是可从原始动作序列中解析出的普遍动作模式,这些模式代表更贴近指令的更高层语义。当元动作作为额外训练信号时,智能体对未见环境的泛化能力更好。相较于强大的多模态Transformer基线,我们在ALFRED具身指令跟随的未见环境中取得了成功率上4.5%的绝对提升。进一步分析表明,对比目标与元动作在实现最佳结果上互为补充,且所得智能体更好地将其状态与对应指令对齐,更适用于真实世界具身智能体。代码见:https://github.com/joeyy5588/LACMA。

关键词

引用

@article{arxiv.2310.12344,
  title  = {LACMA: Language-Aligning Contrastive Learning with Meta-Actions for Embodied Instruction Following},
  author = {Cheng-Fu Yang and Yen-Chun Chen and Jianwei Yang and Xiyang Dai and Lu Yuan and Yu-Chiang Frank Wang and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2310.12344},
  year   = {2023}
}

备注

EMNLP 2023