VisuCraft:通过结构化信息提取增强大型视觉语言模型以实现复杂视觉引导的创意内容生成
计算机视觉与模式识别
2025-08-06 v1 计算与语言
摘要
本文介绍了 VisuCraft,一种旨在显著增强大型视觉语言模型(LVLMs)在复杂视觉引导创意内容生成方面能力的新框架。现有的 LVLMs 在生成长文本时,常在保持高视觉保真度、真实创造力以及精确遵循细致用户指令方面表现出局限性。VisuCraft 通过集成多模态结构化信息提取器(E)和动态提示生成模块(G)来解决这些挑战。该提取器从输入图像中提取细粒度视觉属性,将其转化为丰富的结构化表示;随后,动态提示模块将其与用户指令相结合,为底层 LVLMs(如 LLaVA、InstructBLIP)创建高度优化的提示。在自建的 ImageStoryGen-500K 数据集上,使用 VisuGen 指标(视觉定位、创造力和指令遵循)进行评估,VisuCraft 在故事生成和诗歌创作等任务上始终优于基线 LVLMs。结果表明,其在创造力和指令遵循方面有显著提升,验证了 VisuCraft 在生成富有想象力、具有视觉基础且符合用户意图的长篇创意文本方面的有效性。这项工作为 LVLMs 在高级创意 AI 应用中释放了新的潜力。
引用
@article{arxiv.2508.02890,
title = {VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction},
author = {Rongxin Jiang and Robert Long and Chenghao Gu and Mingrui Yan},
journal= {arXiv preprint arXiv:2508.02890},
year = {2025}
}