增强注意力:利用人类注意力进行图像字幕生成
计算机视觉与模式识别
2019-04-02 v1
摘要
视觉注意力已在图像字幕生成中显示出效用,其目标是使字幕模型能够选择性地聚焦于感兴趣区域。现有模型通常依赖自顶向下的语言信息,并通过优化字幕生成目标来隐式地学习注意力。虽然有一定效果,但在没有注意力直接监督的情况下,所学的自顶向下注意力可能无法聚焦于正确的感兴趣区域。受不仅由任务特定的自顶向下信号而且由视觉刺激驱动的人类视觉系统的启发,我们在本工作中提出将两类注意力均用于图像字幕生成。具体而言,我们强调了两类注意力的互补性质,并开发了一个模型(Boosted Attention)将它们整合用于图像字幕生成。我们在各种评价指标上以最先进的性能验证了所提方法。
引用
@article{arxiv.1904.00767,
title = {Boosted Attention: Leveraging Human Attention for Image Captioning},
author = {Shi Chen and Qi Zhao},
journal= {arXiv preprint arXiv:1904.00767},
year = {2019}
}
备注
Published in ECCV 2018