中文

面向具身语言理解的基于矩的对抗训练

机器人学 2022-04-05 v1 计算与语言 计算机视觉与模式识别

摘要

本文关注一个视觉与语言任务,其中机器人被指示执行家务任务。给定如“冲洗一个杯子并将其放入咖啡机”这样的指令,机器人需要找到杯子、清洗它并将其放入咖啡机。这具有挑战性,因为机器人需要将指令句子分解为子目标并按正确顺序执行。在 ALFRED 基准上,SOTA 方法的性能仍远低于人类。这部分是因为现有方法有时无法推断指令句子中未明确指定的子目标。我们提出基于矩的对抗训练(MAT),其在对抗训练中使用两类矩进行扰动更新。我们将 MAT 引入指令、子目标与状态表示的嵌入空间以处理其多样性。我们在 ALFRED 基准上验证了我们的方法,结果表明我们的方法在基准的所有指标上均优于基线方法。

关键词

引用

@article{arxiv.2204.00889,
  title  = {Moment-based Adversarial Training for Embodied Language Comprehension},
  author = {Shintaro Ishikawa and Komei Sugiura},
  journal= {arXiv preprint arXiv:2204.00889},
  year   = {2022}
}

备注

Accepted for presentation at ICPR2022