基于混合专家的时空语义专家路由架构用于指代图像分割
计算机视觉与模式识别
2026-03-16 v1 人工智能
摘要
指代图像分割旨在为图像中由自然语言描述的区域生成像素级掩码。虽然预训练的视觉语言模型提高了语义对齐,但许多现有方法仍依赖统一的细化策略,无法完全匹配指代表达式所需的多样化推理需求。由于这种不匹配,预测结果常包含碎片化区域、不准确的边界,甚至错误的对象,尤其是在为计算效率而冻结预训练背bone时。为此,我们提出SERA,即用于指代图像分割的时空语义专家路由架构。SERA在视觉语言框架中引入轻量级、表达式感知的专家细化,包含两个互补阶段。首先,我们设计SERA-Adapter,将表达式条件化适配器插入所选背bone块,通过专家引导的细化和跨模态注意力提高空间连贯性和边界精度。随后,我们引入SERA-Fusion,通过将标记特征重塑为空间网格并应用保持几何的专家转换来强化中间视觉表示,随后进行多模态交互。此外,一个轻量级路由机制自适应地加权专家贡献,同时与预训练表示兼容。为使该路由在冻结编码器下保持稳定,SERA采用参数高效调谐策略,仅更新归一化和偏置术 term,影响不足1%的背bone参数。实验在标准指代图像分割基准测试上显示,SERA consistently优于强大 baselines,尤其在需要精确空间定位和精确边界描绘的表达式上获得显著提升。
引用
@article{arxiv.2603.12538,
title = {Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation},
author = {Alaa Dalaq and Muzammil Behzad},
journal= {arXiv preprint arXiv:2603.12538},
year = {2026}
}