面向通用可控图像字幕的组合提示学习方法
计算机视觉与模式识别
2023-08-03 v3
摘要
可控图像字幕(CIC)——在给定控制信号的指导下生成关于图像的自然语言描述——是面向下一代字幕系统最有前景的方向之一。迄今为止,针对 CIC 已提出多种控制信号,涵盖内容相关控制与结构相关控制。然而,由于不同控制信号在格式与目标上存在差异,现有所有 CIC 工作(或架构)仅聚焦于某一种特定控制信号,而忽视了类人的组合能力。所谓“组合”,是指人类在生成描述时可轻松同时满足多种需求(或约束)。为此,我们提出一种新颖的基于提示的 CIC 框架,通过学习组合提示(Combinatorial Prompts),称为 ComPro。具体而言,我们直接采用预训练语言模型 GPT-2 作为语言模型,以弥合不同信号专用 CIC 架构之间的鸿沟。随后,我们将 CIC 重新表述为提示引导的句子生成问题,并提出一种轻量级提示生成网络,为不同种类控制信号生成组合提示。针对不同的控制信号,我们进一步设计了一种新的掩码注意力机制以实现基于提示的 CIC。因其简洁性,我们的 ComPro 可通过拼接这些提示进一步扩展至更多种类的组合控制信号。在两个主流 CIC 基准上的大量实验验证了 ComPro 在单一与组合控制信号上的有效性与高效性。
引用
@article{arxiv.2303.06338,
title = {Learning Combinatorial Prompts for Universal Controllable Image Captioning},
author = {Zhen Wang and Jun Xiao and Yueting Zhuang and Fei Gao and Jian Shao and Long Chen},
journal= {arXiv preprint arXiv:2303.06338},
year = {2023}
}