VIVECaption:一种用于 caption 质量提升的分离方法
计算机视觉与模式识别
2026-03-10 v1
摘要
caption 质量已成为训练高质量文本到图像 (T2I) 和文本到视频 (T2V) 生成模型的关键瓶颈。虽然常部署视觉语言模型 (VLM) 从视觉数据生成 caption,但其 suffer from幻觉、较差的组成推理和有限的细粒度理解,导致图像-caption 对不一致,进而恶化下游模型性能。本技术报告介绍 VIVECaption,一种系统化的双向方法用于 caption 质量提升。我们首先建立了完整的 caption 评估指标分类体系,将其区分为“通用型”和“实例- grounding”型指标,以展示不同 caption 质量指标的用例与权衡。随后,我们使用这种语言描述我们的双向方法:(1) 使用分层抽样创建 gold-standard 数据集方法;(2) 包含 context alignment 和参数级 fine-tuning 的模型对齐策略。我们在开源模型上展示了该方法,聚焦于结构化 caption 格式,以实现更好的解析和下游利用。最终我们展示,使用在图像 captioning 流水线中微调的字符检测模型可显著提高整体图像-caption 对齐质量。我们的工作解决了企业 AI 开发中寻求不依赖可能受版权保护的网络爬虫内容而提升 caption-image 对齐质量的日益增长的需求,为团队提供了实用解决方案。
引用
@article{arxiv.2603.07401,
title = {VIVECaption: A Split Approach to Caption Quality Improvement},
author = {Varun Ananth and Baqiao Liu and Haoran Cai},
journal= {arXiv preprint arXiv:2603.07401},
year = {2026}
}