“勿断章取义”:面向上下文辅助图像字幕生成的统一视觉-语言预训练
计算机视觉与模式识别
2023-06-02 v1 计算与语言
摘要
在企业内容(如营销材料)中,格式良好且上下文感知的图像字幕与标签对于确保其品牌呈现与内容记忆至关重要。鉴于该任务的规模与繁琐性,人工创建与更新以保证这一点并非易事。我们提出一种基于One For All (OFA)模型的新型统一视觉-语言(VL)模型,聚焦于上下文辅助图像字幕生成,即字幕根据图像及其上下文共同生成。我们的方法旨在克服现有方法上下文无关(图像与文本被独立处理)的局限。我们通过使用三项任务的数据集预训练模型来利用上下文:以新闻文章为上下文的新闻图像字幕生成、上下文视觉蕴涵、以及从上下文中提取关键词。第二项预训练任务是一种新的VL任务,我们为此构建并发布了包含两个数据集的任务,数据量分别为1.1M和2.2K条实例。我们的系统在基准新闻图像字幕生成数据集上取得了最先进(state-of-the-art)结果,CIDEr分数提升高达8.34。据我们所知,我们的工作是首次在VL任务模型预训练中融入上下文信息的尝试。
引用
@article{arxiv.2306.00931,
title = {"Let's not Quote out of Context": Unified Vision-Language Pretraining for Context Assisted Image Captioning},
author = {Abisek Rajakumar Kalarani and Pushpak Bhattacharyya and Niyati Chhaya and Sumit Shekhar},
journal= {arXiv preprint arXiv:2306.00931},
year = {2023}
}