Meta-TTRL:统一多模态模型中自我提升测试时强化学习的元认知框架
机器学习
2026-03-18 v1 人工智能
摘要
现有统一多模态模型(UMMs)在文本到图像(T2I)生成中的测试时扩张(TTS)方法主要依赖搜索或抽样策略,仅实现实例级改进,限制了从先前推理中学习并在相似提示之间积累知识的能力。为克服此限制,我们提出了 Meta-TTRL——一种基于模型内在监控信号、源自 UMMS 元知识的测试时参数优化的元认知强化学习框架,实现自我提升和能力级提升。广泛的实验表明,Meta-TTRL 能跨越三个代表性 UMMS(包括 Janus-Pro-7B、BAGEL 和 Qwen-Image),在组合推理任务和多个 T2I 基准上以有限数据显著提升性能。我们提供了首个全面分析,探讨了测试时强化学习(TTRL)在 UMMS T2I 生成中的潜力。我们的分析进一步揭示了有效 TTRL 的关键洞见:元认知协同效应,即监控信号与模型优化 regime 对齐,实现自我提升。
引用
@article{arxiv.2603.15724,
title = {Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models},
author = {Lit Sin Tan and Junzhe Chen and Xiaolong Fu and Lichen Ma and Junshi Huang and Jianzhong Shi and Yan Li and Lijie Wen},
journal= {arXiv preprint arXiv:2603.15724},
year = {2026}
}
备注
8 pages