Visual News:新闻图像描述生成的基准与挑战
计算机视觉与模式识别
2021-09-15 v3
摘要
我们提出 Visual News Captioner,一种用于新闻图像描述生成任务的实体感知模型。我们还引入了 Visual News,一个由超过一百万张新闻图像及关联新闻文章、图像描述、作者信息与其他元数据组成的大规模基准。与标准图像描述任务不同,新闻图像描绘的场景中人物、地点和事件至关重要。我们提出的方法能有效结合视觉与文本特征,生成包含事件与实体等更丰富信息的描述。更具体地,基于 Transformer 架构,我们的模型进一步配备了新颖的多模态特征融合技术与注意力机制,旨在更准确地生成命名实体。我们的方法利用远更少参数,同时取得略优于对比方法的预测结果。我们规模更大且更多样的 Visual News 数据集进一步凸显了新闻图像描述生成中尚存的挑战。
引用
@article{arxiv.2010.03743,
title = {Visual News: Benchmark and Challenges in News Image Captioning},
author = {Fuxiao Liu and Yinghan Wang and Tianlu Wang and Vicente Ordonez},
journal= {arXiv preprint arXiv:2010.03743},
year = {2021}
}
备注
9 pages, 5 figures, accepted to EMNLP2021