中文

可控上下文化图像描述:通过用户定义的突出显示引导视觉叙事

计算机视觉与模式识别 2024-07-17 v1 人工智能

摘要

上下文化图像描述(CIC)正在发展为更复杂的领域,要求模型具备多模态推理能力,以给定的特定上下文信息生成图像描述。本文进一步引入了可控上下文化图像描述(Ctrl-CIC)的新范式。不同于CIC仅依赖宽泛上下文,Ctrl-CIC强调用户定义的突出显示内容,迫使模型生成与突出显示的上下文方面相呼应的描述。我们提出两种方法:基于提示的控制器(P-Ctrl)和基于重校准的控制器(R-Ctrl),用于生成有针对性的描述。P-Ctrl通过在描述前缀中添加突出显示驱动的文本来条件化模型生成,而R-Ctrl则对突出显示的token进行选择性重校准编码器嵌入。此外,我们设计了一个基于GPT-4V的评估器来评估受控描述的质量,同时结合标准评估方法。大量实验结果表明,我们的方法在可控性方面表现高效且有效,开辔了实现用户自适应图像描述的新方向。代码已公开于 https://github.com/ShunqiM/Ctrl-CIC。

关键词

引用

@article{arxiv.2407.11449,
  title  = {Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights},
  author = {Shunqi Mao and Chaoyi Zhang and Hang Su and Hwanjun Song and Igor Shalyminov and Weidong Cai},
  journal= {arXiv preprint arXiv:2407.11449},
  year   = {2024}
}

备注

ECCV 2024