中文

通过建模人类注意力轨迹连接言说内容与注视位置

计算机视觉与模式识别 2021-05-14 v1

摘要

我们引入一个统一框架,联合建模图像、文本与人类注意力轨迹。我们的工作构建于近期的Localized Narratives标注框架[30]之上,其中给定字幕的每个词都与一段鼠标轨迹配对。我们提出两个新任务:(1)给定图像与字幕预测轨迹(即视觉定位),(2)仅给定图像预测字幕与轨迹。由于人类提供轨迹中的噪声以及存在无法被有意义地进行视觉定位的词,学习每个词的定位具有挑战性。我们提出一种在双任务(受控轨迹生成与受控字幕生成)上联合训练的新模型架构。为评估生成轨迹的质量,我们提出一种局部二部匹配(LBM)距离度量,可比较两条长度不同的轨迹。大量实验表明我们的模型对不完美的训练数据具有鲁棒性,并以明显优势超越基线。此外,我们证明在提出任务上预训练的模型亦有益于COCO引导图像字幕这一下游任务。我们的代码与项目页已公开可用。

关键词

引用

@article{arxiv.2105.05964,
  title  = {Connecting What to Say With Where to Look by Modeling Human Attention Traces},
  author = {Zihang Meng and Licheng Yu and Ning Zhang and Tamara Berg and Babak Damavandi and Vikas Singh and Amy Bearman},
  journal= {arXiv preprint arXiv:2105.05964},
  year   = {2021}
}