CASHEW: 通过迭代轨迹聚合稳定多模态推理
计算机视觉与模式识别
2026-01-14 v1
摘要
视觉-语言模型在广泛的多模态理解和推理任务中表现出色,但其多步推理仍不稳定。对同一输入进行重复采样通常会产生发散性的推理轨迹和不一致的最终预测。为了解决这个问题,我们引入了两种受测试时扩展启发的互补方法:(1) CASHEW,一个推理时框架,通过迭代地将多个候选轨迹聚合为更高质量的推理轨迹来稳定推理,并利用显式的视觉验证过滤幻觉步骤,将推理锚定在视觉证据上;(2) CASHEW-RL,一个学习变体,将这种聚合行为内化到单个模型中。CASHEW-RL 使用组序列策略优化(GSPO)进行训练,并采用复合奖励,该奖励鼓励基于最少但充分的视觉证据得出正确答案,同时根据任务难度自适应地分配推理努力。这种训练目标使得推理时能够进行鲁棒的自我聚合。在13个图像理解、视频理解和视频推理基准上的大量实验表明,性能显著提升,包括在ScienceQA上提升高达23.6个百分点,在EgoSchema上提升8.1个百分点。
引用
@article{arxiv.2601.08010,
title = {CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation},
author = {Chaoyu Li and Deeparghya Dutta Barua and Fei Tao and Pooyan Fazli},
journal= {arXiv preprint arXiv:2601.08010},
year = {2026}
}