中文

利用 Touch-Line Transformer 理解具身指称

计算机视觉与模式识别 2022-10-13 v2

摘要

我们研究具身指称理解,即利用具身手势信号与语言指称来定位指称对象的任务。人类研究表明,被指称或指向的物体并不位于肘-腕连线上(一种常见误解);相反,它们位于所谓的虚拟触摸线上。然而,现有人体姿态表示未能纳入虚拟触摸线。为解决此问题,我们设计了 touch-line transformer:它以令牌化的视觉与文本特征为输入,同时预测指称对象的边界框与一条触摸线向量。利用该触摸线先验,我们进一步设计了一种几何一致性损失,以鼓励指称对象与触摸线之间的共线性。使用触摸线作为手势信息显著提升了模型性能。在 YouRefIt 数据集上的实验表明,我们的方法在 0.75 IoU 准则下取得了 +25.0% 的精度提升,弥合了模型与人类性能之间 63.6% 的差距。此外,我们通过计算验证先前的人类研究,表明计算模型在使用虚拟触摸线时比使用肘-腕连线时能更准确地定位指称对象。

关键词

引用

@article{arxiv.2210.05668,
  title  = {Understanding Embodied Reference with Touch-Line Transformer},
  author = {Yang Li and Xiaoxue Chen and Hao Zhao and Jiangtao Gong and Guyue Zhou and Federico Rossano and Yixin Zhu},
  journal= {arXiv preprint arXiv:2210.05668},
  year   = {2022}
}

备注

Code: https://github.com/Yang-Li-2000/Understanding-Embodied-Reference-with-Touch-Line-Transformer.git