中文

HAAV:用于图像字幕的增强视图层次化聚合

计算机视觉与模式识别 2023-05-26 v1 人工智能

摘要

在图像字幕方面已取得大量进展,其驱动力来自如何使用预训练模型编码图像的研究。这包括视觉编码(如图像网格特征或检测对象)以及近来的文本编码(如图像标签或图像区域的文本描述)。随着更先进的编码可用并被整合,一个自然的问题是:如何高效且有效地利用这组异构编码?在本文中,我们提议将这些编码视为输入图像的增强视图。图像字幕模型用共享编码器高效地独立编码每个视图,并以一种新颖方式在编码视图间引入对比损失,以提升其表示质量与模型的数据效率。我们提出的层次化解码器随后通过在 token 级别先聚合每个视图内部、再在视图级别跨视图,根据各视图对字幕生成的有效性自适应地加权编码视图。我们展示了相比 SOTA 在 MS-COCO 上 +5.6% CIDEr、在 Flickr30k 上 +12.9% CIDEr 的显著性能提升,并进行了严谨分析以证明我们设计中各部分的重要性。

关键词

引用

@article{arxiv.2305.16295,
  title  = {HAAV: Hierarchical Aggregation of Augmented Views for Image Captioning},
  author = {Chia-Wen Kuo and Zsolt Kira},
  journal= {arXiv preprint arXiv:2305.16295},
  year   = {2023}
}

备注

Paper accepted in CVPR-23; Project page and code available here: https://sites.google.com/view/chiawen-kuo/home/haav