中文

Target-dependent UNITER: 一种面向家用服务机器人的基于 Transformer 的多模态语言理解模型

机器人学 2021-07-05 v1 计算与语言 计算机视觉与模式识别

摘要

当前,家用服务机器人通过语言自然交互的能力不足。这是因为理解人类指令因各种歧义与信息缺失而复杂化。在现有方法中,指定物体间关系的指称表达未被充分建模。本文提出 Target-dependent UNITER,其通过聚焦图像内相关区域而非整幅图像,直接学习目标物体与其他物体间的关系。我们的方法是对可基于通用数据集预训练的 UNITER-based Transformer 的扩展。我们通过引入处理目标候选的新架构扩展了 UNITER 方法。我们的模型在两个标准数据集上得到验证,结果显示 Target-dependent UNITER 在分类准确率上优于基线方法。

关键词

引用

@article{arxiv.2107.00811,
  title  = {Target-dependent UNITER: A Transformer-Based Multimodal Language Comprehension Model for Domestic Service Robots},
  author = {Shintaro Ishikawa and Komei Sugiura},
  journal= {arXiv preprint arXiv:2107.00811},
  year   = {2021}
}

备注

Accepted for presentation at IROS2021