VACoT:重新思考视觉数据增强 with VLMs
计算机视觉与模式识别
2025-12-03 v1 人工智能
摘要
虽然视觉数据增强一直是训练稳健视觉模型的基石,但在视觉语言模型 (VLM) 中受到了有限的关注,这些模型主要依赖大规模真实数据获取或合成多样性。因此,它们可能在常规模型可靠处理的基本感知任务中感到困难。鉴于预训练和微调VLMs的巨大成本,对增强数据进行继续训练仅产生有限且递减的收益。在本文中,我们提出了视觉增强链式思维 (VACoT) 框架,在模型推理期间动态调用图像增强。通过纳入后处理转换如去噪,VACoT在挑战性和分布外输入上尤其在OCR相关对抗场景中显著提高了鲁棒性。与局部裁剪的先前方法不同,VACoT整合了结构化的通用视觉增强集合,扩宽查询图像的视图范围,同时通过高效的智能体强化学习降低训练复杂度和计算开销。我们提出了条件奖励方案,以鼓励必要的增强同时惩罚冗长的响应,确保感知任务中简洁且有效的推理。我们在13个感知基准测试上展示了VACoT的优越性,并进一步引入AdvOCR,以突出后处理视觉增强在对抗场景中的泛化优势。
引用
@article{arxiv.2512.02361,
title = {VACoT: Rethinking Visual Data Augmentation with VLMs},
author = {Zhengzhuo Xu and Chong Sun and SiNan Du and Chen Li and Jing Lyu and Chun Yuan},
journal= {arXiv preprint arXiv:2512.02361},
year = {2025}
}