MergeMix: 面向视觉与多模态理解的统一数据增强范式
计算机视觉与模式识别
2026-02-03 v3
摘要
视觉语言对齐在多模态大语言模型(MLLM)中依赖监督微调(SFT)或强化学习(RL)。为实现后训练阶段的对齐,SFT 稳定但需要人工标注且缺乏任务泛化,RL 则依赖奖励信号搜索更优答案,但存在计算开销和不稳定性。为在可扩展性、效率和对齐泛化之间取得平衡,我们提出 MergeMix,一种统一范式,通过基于 Token Merge 的 Mixup 数据增强桥接 SFT 与 RL。关于 Mixup 策略,我们根据合并注意力图中的聚类区域生成相应标签的上下文对齐混合图像。然后,我们通过构建原始图像与 MergeMix 生成图像的偏好对,优化混合 SimPO loss 中的软偏好间隙,增强 MLLM 的偏好驱动范式。广泛实验表明,MergeMix 不仅作为数据增强方法实现优异分类准确率,还提升了 MLLM 的泛化能力和对齐效果,为具有训练效率和稳定性的偏好对齐提供了新范式。
关键词
引用
@article{arxiv.2510.23478,
title = {UrbanIng-V2X: A Large-Scale Multi-Vehicle, Multi-Infrastructure Dataset Across Multiple Intersections for Cooperative Perception},
author = {Karthikeyan Chandra Sekaran and Markus Geisler and Dominik Rößle and Adithya Mohan and Daniel Cremers and Wolfgang Utschick and Michael Botsch and Werner Huber and Torsten Schön},
journal= {arXiv preprint arXiv:2510.23478},
year = {2026}
}
备注
Accepted to NeurIPS 2025. Including supplemental material. For code and dataset, see https://github.com/thi-ad/UrbanIng-V2X