基于增量优化效用的高效多模态模型数据选择
人工智能
2026-05-11 v1 机器学习
摘要
大型多模态模型 (LMM) 的规模受制于合成数据中质量-数量权衡的内在限制。以往方法,如 LLM-as-a-Judge,虽在 addressing 这一问题方面证明有效,但受计算成本高昂和缺乏可解释性的制约。为填补这一差距,我们提出了 One-Step-Train (OST),将数据选择重新表述为增量优化效用排序问题。与依赖语义启发式不同,OST 通过对轻量代理进行模拟单步更新来估计每个样本的边际效用。在 Qwen 系列跨多模态数学推理基准测试上的实验表明,OST 实现了帕累托最优效率。通过选择前 50 个样本,OST 将训练成本降低 43%(总耗时降低 17),并在方面超过强大的 LLM-as-a-Judge 基线提升 1.8 分。此外,在固定计算预算下,我们的方法仅使用前 20 个样本即可比 LLM-as-a-Judge 提升 5.6 分,改进了诸如 DEITA 等启发式评分基线,并超过 Full-SFT 基线提升 8.8 分。值得注意的是,尽管 Full-SFT 因噪声而出现性能下降,但我们的优化导向方法有效识别出有毒样本,成功逆转了复杂推理任务中常见的负迁移。
引用
@article{arxiv.2605.07488,
title = {Efficient Data Selection for Multimodal Models via Incremental Optimization Utility},
author = {Jinhao Jing and Qiannian Zhao and Chao Huang and Zhan Su},
journal= {arXiv preprint arXiv:2605.07488},
year = {2026}
}