中文

DialMAT:具有基于矩对抗训练的对话使能Transformer

计算机视觉与模式识别 2023-11-14 v1 计算与语言 机器人学

摘要

本文关注DialFRED任务,即在智能体可主动询问有关任务问题的设定下的具身指令跟随任务。针对该任务,我们提出DialMAT。DialMAT引入了基于矩的对抗训练,其将对抗扰动注入语言、图像和动作的潜在空间。此外,它引入了一种跨模态并行特征提取机制,将基础模型应用于语言和图像。我们使用基于DialFRED数据集构建的数据集评估了我们的模型,并在成功率和路径加权成功率方面展示了优于基线方法的性能。该模型在CVPR 2023具身AI研讨会举办的DialFRED挑战赛中夺得首位。

关键词

引用

@article{arxiv.2311.06855,
  title  = {DialMAT: Dialogue-Enabled Transformer with Moment-Based Adversarial Training},
  author = {Kanta Kaneda and Ryosuke Korekata and Yuiga Wada and Shunya Nagashima and Motonari Kambara and Yui Iioka and Haruka Matsuo and Yuto Imai and Takayuki Nishimura and Komei Sugiura},
  journal= {arXiv preprint arXiv:2311.06855},
  year   = {2023}
}

备注

Accepted for presentation at Fourth Annual Embodied AI Workshop at CVPR