描述-然后生成瓶颈:VLM描述如何改变图像生成结果
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
随着多模态AI系统在创意工作流中的日益集成,理解视觉-语言-视觉流水线中的信息丢失对于评估系统局限性变得重要。然而,视觉内容经过文本中介时发生的退化仍然缺乏量化。在本工作中,我们对描述-然后生成瓶颈进行了实证分析,其中自然语言作为视觉信息的中介表示。我们通过描述-然后生成流水线生成了150对图像,并应用现有指标(LPIPS、SSIM和颜色距离)来测量跨感知、结构和色度维度的信息保持。我们的评估显示99.3%的样本表现出显著的感知退化,91.5%表现出显著的结构信息丢失,为描述-然后生成瓶颈是当代多模态系统中可测量且一致的局限性提供了实证证据。
引用
@article{arxiv.2509.18179,
title = {The Describe-Then-Generate Bottleneck: How VLM Descriptions Alter Image Generation Outcomes},
author = {Sai Varun Kodathala and Rakesh Vunnam},
journal= {arXiv preprint arXiv:2509.18179},
year = {2025}
}
备注
13 pages, 7 Figures