将漂移转化为约束:非平稳多流环境中鲁棒的推理对齐
计算机视觉与模式识别
2026-05-12 v3 人工智能
机器学习
摘要
本文识别了来自多个多模态大语言模型(MLLM)的推理对齐中的一个关键且未被充分探索的挑战:在非平稳环境中,源模型的多样化推理分布常常不可预测地演化,将系统性偏差和漂移传递给目标模型。为解决此问题,我们在概念漂移理论下,将多源推理对齐形式化为约束满足问题。我们提出一种名为自主偏好优化(APO)的新框架,将模型间的差异不作为噪声,而是作为动态负约束来处理。APO通过两个阶段运行:首先,监督引导将目标模型投影到源模型能力的并集;其次,约束感知优化通过抑制漂移轨迹于多负Plackett-Luce目标下合成一致的共识流形。针对胸部X光诊断展开大量实验,证明我们的7B模型在平均准确率上超越了甚至是专有源模型。此外,我们发布了CXR-MAX,一个由七个大型MLLM生成的170,982条推理轨迹构成的大规模基准,以促进漂移下推理对齐的研究。代码和数据已发布。
引用
@article{arxiv.2510.04142,
title = {Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments},
author = {Xiaoyu Yang and En Yu and Wei Duan and Jie Lu},
journal= {arXiv preprint arXiv:2510.04142},
year = {2026}
}
备注
ICML 2026