RICO:通过视觉重建提升图像重写标题的准确性与完整性
计算机视觉与模式识别
2025-05-29 v1 人工智能
计算与语言
摘要
图像重写标题被广泛用于为各种多模态任务生成具有增强质量的训练数据集。现有的重写标题方法通常依赖强大的多模态大语言模型(MLLMs)来增强文本描述,但由于幻觉以及因缺失细粒度细节而导致的不完整性,往往会产生不准确的结果。为了解决这些局限性,我们提出了 RICO,这是一个通过视觉重建来优化标题的新颖框架。具体而言,我们利用文本到图像模型将标题重建为参考图像,并提示 MLLM 识别原始图像与重建图像之间的差异以优化标题。该过程迭代执行,进一步逐步促进生成更忠实且更全面的描述。为了减轻由迭代过程引入的额外计算成本,我们引入了 RICO-Flash,它学习使用 DPO 像 RICO 一样生成标题。大量实验表明,我们的方法显著提高了标题的准确性和完整性,在 CapsBench 和 CompreCap 上均比大多数基线高出约 10%。代码已发布于 https://github.com/wangyuchi369/RICO。
引用
@article{arxiv.2505.22613,
title = {RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction},
author = {Yuchi Wang and Yishuo Cai and Shuhuai Ren and Sihan Yang and Linli Yao and Yuanxin Liu and Yuanxing Zhang and Pengfei Wan and Xu Sun},
journal= {arXiv preprint arXiv:2505.22613},
year = {2025}
}
备注
code: https://github.com/wangyuchi369/RICO