通过序列跨模态对齐与人眼注视引导生成图像描述
计算与语言
2020-11-10 v1 计算机视觉与模式识别
摘要
当说话者描述一幅图像时,他们往往会在提及物体之前注视该物体。本文通过计算建模图像描述生成过程,研究这种序列跨模态对齐。我们以最先进的图像字幕系统为起点,开发了若干利用语言产生过程中记录的人眼注视模式信息的模型变体。特别地,我们提出了首个将视觉处理建模为序列化的图像描述生成方法。我们的实验与分析证实,利用注视驱动的注意力可获得更好的描述,并通过比较将注视模态与语言产生对齐的不同方式,揭示了人类认知过程。我们发现,序列化处理注视数据所生成的描述与说话者产生的描述对齐更好、更多样且更自然——尤其在以专用循环组件编码注视时。
引用
@article{arxiv.2011.04592,
title = {Generating Image Descriptions via Sequential Cross-Modal Alignment Guided by Human Gaze},
author = {Ece Takmaz and Sandro Pezzelle and Lisa Beinborn and Raquel Fernández},
journal= {arXiv preprint arXiv:2011.04592},
year = {2020}
}
备注
In Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP 2020)