中文

MM-SeR:轻量级图像描述的多模态自我精炼

计算机视觉与模式识别 2025-12-15 v4

摘要

诸如视频聊天机器人和导航机器人等系统往往依赖流式图像描述来解释视觉输入。现有方法通常采用大型多模态语言模型(MLLMs),但其巨大的计算成本限制了实际应用。为此,我们开发了一个轻量级描述模型。我们的研究首先通过替换MLLMs中的大规模语言组件来实现这一目标,采用规模仅为1.25亿参数的紧凑模型。令人惊讶的是,尽管规模缩小93倍,这个紧凑模型在可比MLLMs方面实现了相当好的性能,这表明事实图像描述并不显著需要LLM的复杂推理能力。尽管有这个有前景的结果,但我们的轻量级模型仍然不可靠。为此,我们借鉴了人类视觉过程:在注意细节之前先整体粗糙地理解场景。因此,我们提出了一种多模态自我精炼框架,引导模型利用来自先前粗糙描述的参考,从突出区域获取特征,以产生精炼后的描述。实验结果表明,我们的模型在单句描述和详细描述方面都表现出优越性,甚至延伸到长期视频问答任务。

关键词

引用

@article{arxiv.2508.21451,
  title  = {MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning},
  author = {Junha Song and Yongsik Jo and So Yeon Min and Quanting Xie and Taehwan Kim and Yonatan Bisk and Jaegul Choo},
  journal= {arXiv preprint arXiv:2508.21451},
  year   = {2025}
}

备注

Project page: https://sites.google.com/view/junha/mm-ser