MAPLE:模态感知的后训练与学习生态系统
人工智能
2026-02-13 v1
摘要
多模态语言模型现在集成了文本、音频和视频,以实现统一推理。然而,现有的强化学习后训练管道将所有输入信号视为 equally relevant,忽略了每个任务实际需要的模态。这种模态盲训练会增加策略梯度方差,减慢收敛,并降低对现实分布迁移的鲁棒性——在这种情况下,信号可能缺失、添加或重新加权。我们引入 MAPLE,一个完整的模态感知后训练和学习生态系统,包括:(1) MAPLE-bench,第一个明确标注每个任务所需的最小信号组合的基准;(2) MAPO,一种模态感知的策略优化框架,通过按模态需求对 batch 进行分层来减少来自异构组别优势的梯度方差;(3) 自适应加权与课程安排,以平衡和优先处理更难的信号组合。对损失聚合、裁剪、抽样和课程设计的系统性分析确立了 MAPO 的最优训练策略。自适应加权和课程聚焦学习进一步提升了所有信号组合下的性能。MAPLE 将 uni/multi-modal 准确率差距缩小 30.24%,收敛速度快 3.18 倍,在现实可用的减少信号下保持稳定。MAPLE 提供了部署就绪的多模态 RL 后训练配方。
引用
@article{arxiv.2602.11596,
title = {MAPLE: Modality-Aware Post-training and Learning Ecosystem},
author = {Nikhil Verma and Minjung Kim and JooYoung Yoo and Kyung-Min Jin and Manasa Bharadwaj and Kevin Ferreira and Ko Keun Kim and Youngjoon Kim},
journal= {arXiv preprint arXiv:2602.11596},
year = {2026}
}
备注
31 pages