解锁认知能力:分析感知-逻辑之间的权衡
人工智能
2026-03-02 v1
摘要
最近的多模态大语言模型(MLLMs)追求全感知能力,但将稳健的感官 grounding 与复杂推理相结合仍然具有挑战,尤其是针对欠代表性地区。本报告介绍我们研究预览版 MERaLiON2-Omni(Alpha),这是一款面向东南亚(SEA)的 10B 参数无感知 omni 定制模型。我们提出了渐进式训练管道,显式地解耦并整合"系统 1"(感知)和"系统 2"(推理)能力。首先,我们通过正交模态适应,将区域特定的音频-视觉线索(如 Singlish 混合语言、当地文化地标)与多语言 LLM 对齐,以建立稳健的感知 Backbone。其次,为了在缺乏大规模监督的情况下注入认知能力,我们提出一种成本效益高的 Generate-Judge-Refine 管道。通过利用超大 LLM 过滤幻觉并通过共识机制解决冲突,我们合成高质量的银数据,将文本链式思维推理传递到多模态场景。对我们新引入的 SEA-Omni Benchmark Suite 进行全面评估,发现存在效率-稳定性悖论:尽管推理在抽象任务中表现为非线性放大器(显著提升数学和指令跟随性能),但在低层次感官处理中引入不稳定性。具体而言,我们识别出在长时段音频中的时间漂移,即延长推理会使模型与声学时间戳不同步,以及视觉过度解释,即逻辑会覆盖像素级现实。本报告详细描述了架构、数据高效训练配方以及稳健感知与结构化推理之间的权衡。
引用
@article{arxiv.2602.23730,
title = {Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off},
author = {Longyin Zhang and Shuo Sun and Yingxu He and Won Cheng Yi Lewis and Muhammad Huzaifah Bin Md Shahrin and Hardik Bhupendra Sailor and Heng Meng Jeremy Wong and Tarun Kumar Vangani and Yi Ma and Qiongqiong Wang and Minh Duc Pham and Ridong Jiang and Jingtao Li and Jingyi Liao and Zhuohan Liu and Yanfeng Lu and Manas Gupta and Ai Ti Aw},
journal= {arXiv preprint arXiv:2602.23730},
year = {2026}
}