VILA$^2$:VILA 增强版 VILA
计算机视觉与模式识别
2024-11-04 v2
摘要
虽然视觉语言模型架构和训练基础设施正在快速发展,但数据策展仍未得到充分探索,其中数量和质量成为瓶颈。现有工作要么爬取额外的互联网数据以松散保证质量,要么从黑箱专有模型(如 GPT-4V / Gemini)蒸馏,这些模型受 API 调用频率和性能限制。本工作使 VLM 能够通过数据增强自我改进,利用其生成特性。我们引入一种简单而有效的 VLM 增强方案,包括自增强步骤和专家增强步骤,以迭代提高数据质量,从而提升模型性能。在自增强步骤中,指令微调的 VLM 重新描述其预训练 caption 数据集,然后利用改进后的数据从头重新训练。没有任何昂贵的人类在环注释,我们观察到数据质量和下游准确率提升,通过三轮自增强实现——一种为当前 VLM 训练配方的可行的免费午餐。当自增强饱和后,我们通过利用指令微调中获取的专门技能来增强 caption 的多样性。我们从自增强的 VLM 中微调 VLM 专家,包括空间、grounding 和 OCR 领域的专家,将任务感知合成数据融入预训练阶段。数据质量改进和幻觉减少由 VLM(GPT-4V、Gemini)和人类评判家进行交叉检查。结合自增强和专家增强训练,VILA 在广泛的基准测试上 consistently 提升准确率,生产出一个 300 倍比人类标注更具成本效益的可重用预训练数据集。
引用
@article{arxiv.2407.17453,
title = {VILA$^2$: VILA Augmented VILA},
author = {Yunhao Fang and Ligeng Zhu and Yao Lu and Yan Wang and Pavlo Molchanov and Jan Kautz and Jang Hyun Cho and Marco Pavone and Song Han and Hongxu Yin},
journal= {arXiv preprint arXiv:2407.17453},
year = {2024}
}