超越过滤:自适应图像文本质量提升用于 MLLM 预训练
计算机视觉与模式识别
2024-10-22 v1 计算与语言
摘要
多模态大语言模型(MLLM)通过整合视觉和文本模态取得了显著进展。训练 MLLM 的关键因素是图像文本对在多模态预训练数据集中的质量。然而,事实上的基于过滤的数据质量提升范式常因图像和文本之间的语义对齐不足,导致大量高质量图像数据被丢弃,数据利用效率和可扩展性受到制约。本文提出自适应图像文本质量增强器(AITQE),一种动态评估和提升图像文本对质量的模型。AITQE 采用文本重写机制处理低质量图像文本对,并整合刻意挑选的低质量样本进行负采样学习,以提升评估能力。与既有方法不同,我们的方法仅对文本进行最小调整,以保持数据量的同时提升质量。实验结果表明,AITQE 在各种基准上超越了现有方法,有效利用原始数据并随数据量增加而高效扩展。我们希望本工作能激发未来研究。代码和模型可在 https://github.com/hanhuang22/AITQE 查看。
引用
@article{arxiv.2410.16166,
title = {Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining},
author = {Han Huang and Yuqi Huo and Zijia Zhao and Haoyu Lu and Shu Wu and Bingning Wang and Qiang Liu and Weipeng Chen and Liang Wang},
journal= {arXiv preprint arXiv:2410.16166},
year = {2024}
}