中文

M2IST:面向高效指代语义理解的多模态交互式副调谐

计算机视觉与模式识别 2025-03-14 v4

摘要

指代语义理解(REC)是一种基于语言表达式在图像中定位目标对象的视觉语言任务。完全对通用预训练视觉语言基础模型进行 REC 全参数微调可获得卓越的性能,但开销日益增加。参数高效迁移学习(PETL)方法以更少的可调参数展示出强大的性能。然而,直接将 PETL 应用于 REC 面临两个挑战:(1)预训练视觉语言基础模型之间模态交互不足,(2)由于梯度通过重型视觉语言基础模型,导致 GPU 内存使用率高。为此,我们提出了 M2IST:多模态交互式副调谐,包含 M3ISAs:混合多模态交互副适配器。在微调期间,我们固定预训练的单模态编码器,并更新 M3ISAs 以实现 REC 的高效视觉语言对齐。实验结果表明,M2IST 在性能与效率之间取得了更好的平衡点,仅需 2.11% 可调参数、39.61% GPU 内存和 63.46% 的训练时间,同时保持了具竞争力的性能。我们的代码已发布于 https://github.com/xuyang-liu16/M2IST。

关键词

引用

@article{arxiv.2407.01131,
  title  = {M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension},
  author = {Xuyang Liu and Ting Liu and Siteng Huang and Yi Xin and Yue Hu and Quanjun Yin and Donglin Wang and Yuanyuan Wu and Honggang Chen},
  journal= {arXiv preprint arXiv:2407.01131},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)