ScaleCap:基于双模态去偏推理时间可扩展图像字幕
计算机视觉与模式识别
2025-06-25 v1 计算与语言
摘要
本文提出ScaleCap,一种推理时间可扩展的图像字幕策略,用于生成全面且详尽的图像字幕。高质量图像字幕的关键挑战在于LVLMs内在的偏见:多模态偏见导致描述粒度不平衡——对某些元素进行详细描述,而对其他元素仅粗略概述;语言偏见导致对不存在物体的幻觉式描述。为解决这些问题,我们提出一种可扩展去偏字幕策略,通过增加推理预算不断丰富和校准字幕。具体而言,我们提出了两个新颖组件:启发式问答与对比句评分。前者基于图像生成特定问题并回答问题,以逐步注入相关信息;后者采用句子级离线对比解码,有效识别并消除由语言偏见引起的幻觉。随着推理成本的增加,ScaleCap提出更多启发式问题,以捕获更多视觉细节,生成更准确、更平衡、更具信息量的字幕。广泛的模态对齐实验表明ScaleCap有效。将ScaleCap标注450K张图像并用于LVLlm预训练,可在11个广泛使用的基准测试中实现持续的性能提升。此外,ScaleCap在两个额外任务中展现出卓越的丰富性和忠实性:在VQA任务中以字幕替换图像,或从字幕重建图像以评估语义覆盖范围。代码已公开:https://github.com/Cooperx521/ScaleCap。
引用
@article{arxiv.2506.19848,
title = {ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing},
author = {Long Xing and Qidong Huang and Xiaoyi Dong and Pan Zhang and Yuhang Zang and Yuhang Cao and Jinsong Li and Shuangrui Ding and Weiming Zhang and Nenghai Yu and Jiaqi Wang and Feng Wu and Dahua Lin},
journal= {arXiv preprint arXiv:2506.19848},
year = {2025}
}
备注
Code is available at https://github.com/Cooperx521/ScaleCap