CapEnrich:基于跨模态预训练知识丰富网络图像的描述语义
计算机视觉与模式识别
2023-03-21 v3 多媒体
摘要
为网络上海量无标注图像自动生成文本描述可极大惠及现实网络应用,例如多模态检索与推荐。然而,现有模型存在生成“过度通用”描述的问题,例如倾向于为不同图像生成含常见概念的重复句子。这些通用描述无法为不断变化的网络图像提供充分的文本语义。受近期视觉-语言预训练(VLP)模型在预训练中学习到多样图像-文本概念对齐的成功启发,我们探索利用其跨模态预训练知识自动丰富图像描述的文本语义。无需额外人工标注,我们提出一种即插即用框架,即 CapEnrich,以更多语义细节补充通用图像描述。具体而言,我们首先提出一种自动数据构建策略以获取所需的训练句子,并基于此采用提示策略(即可学习与模板提示)激励 VLP 模型生成更多文本细节。对于可学习模板,我们固定整个 VLP 模型而仅调优提示向量,这带来两点优势:1) 尽可能保留 VLP 模型的预训练知识以描述多样视觉概念;2) 仅需轻量级可训练参数,因而对低数据资源友好。大量实验表明,我们的方法显著提升了网络图像生成句子的描述性与多样性。代码见 https://github.com/yaolinli/CapEnrich。
引用
@article{arxiv.2211.09371,
title = {CapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge},
author = {Linli Yao and Weijing Chen and Qin Jin},
journal= {arXiv preprint arXiv:2211.09371},
year = {2023}
}
备注
Accepted to WWW2023