可控上下文化图像描述:通过用户定义的突出显示引导视觉叙事
计算机视觉与模式识别
2024-07-17 v1 人工智能
摘要
上下文化图像描述(CIC)正在发展为更复杂的领域,要求模型具备多模态推理能力,以给定的特定上下文信息生成图像描述。本文进一步引入了可控上下文化图像描述(Ctrl-CIC)的新范式。不同于CIC仅依赖宽泛上下文,Ctrl-CIC强调用户定义的突出显示内容,迫使模型生成与突出显示的上下文方面相呼应的描述。我们提出两种方法:基于提示的控制器(P-Ctrl)和基于重校准的控制器(R-Ctrl),用于生成有针对性的描述。P-Ctrl通过在描述前缀中添加突出显示驱动的文本来条件化模型生成,而R-Ctrl则对突出显示的token进行选择性重校准编码器嵌入。此外,我们设计了一个基于GPT-4V的评估器来评估受控描述的质量,同时结合标准评估方法。大量实验结果表明,我们的方法在可控性方面表现高效且有效,开辔了实现用户自适应图像描述的新方向。代码已公开于 https://github.com/ShunqiM/Ctrl-CIC。
引用
@article{arxiv.2407.11449,
title = {Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights},
author = {Shunqi Mao and Chaoyi Zhang and Hang Su and Hwanjun Song and Igor Shalyminov and Weidong Cai},
journal= {arXiv preprint arXiv:2407.11449},
year = {2024}
}
备注
ECCV 2024