Caption Anything:基于多样化多模态交互控制的可控图像描述
计算机视觉与模式识别
2023-07-07 v3
摘要
可控图像描述是一个新兴的多模态课题,旨在按照人类意图用自然语言描述图像,例如关注指定区域或以特定文本风格叙述。最先进的方法在输入控制与输出描述标注对上训练。然而,此类良好标注的多模态数据的稀缺性极大限制了它们在交互式 AI 系统中的可用性与可扩展性。利用单模态指令跟随基础模型是一种有前景的替代方案,可从更广泛的数据源中获益。在本文中,我们提出 Caption AnyThing (CAT),一个基础模型增强的图像描述框架,支持广泛的多模态控制:1) 视觉控制,包括点、框与轨迹;2) 语言控制,如情感、长度、语言与事实性。由 Segment Anything Model (SAM) 和 ChatGPT 驱动,我们将视觉与语言提示统一到模块化框架中,实现不同控制间的灵活组合。大量案例研究展示了我们框架的用户意图对齐能力,为视觉-语言应用中的有效用户交互建模提供启示。我们的代码公开于 https://github.com/ttengwang/Caption-Anything。
引用
@article{arxiv.2305.02677,
title = {Caption Anything: Interactive Image Description with Diverse Multimodal Controls},
author = {Teng Wang and Jinrui Zhang and Junjie Fei and Hao Zheng and Yunlong Tang and Zhe Li and Mingqi Gao and Shanshan Zhao},
journal= {arXiv preprint arXiv:2305.02677},
year = {2023}
}
备注
Tech-report