中文

桥接粗粒度与细粒度识别:面向交互式教育游戏的混合式多粒度通用对象识别

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

多模态大语言模型(MLLM)的最新进展已实现开放式对象识别,但在细粒度任务上仍显不足。相比,CLIP式模型在细粒度识别方面优势明显,但缺乏广泛的常规对象类别覆盖。为弥合这一差距,我们提出HyMOR框架,即Hybrid Multi-granularity open-ended Object Recognition(混合式多粒度开放式对象识别),集成MLLM与CLIP模型。HyMOR中,MLLM负责开放式且粗粒度的对象识别,而CLIP模型专注于动物、植物等特定领域对象的细粒度识别。这种混合设计实现了跨多语义粒度的准确对象理解,为下游多模态内容生成与互动游戏提供了稳健的感知基础。为支持内容丰富且面向教育的场景评估,我们引入TBO(TextBook Objects),包含20,942张标注8,816个从教科书提取的对象类别的图像。大量实验表明,HyMOR将CLIP所致的细粒度识别差距缩小至0.2%,同时相较于基准MLLM提升常规对象识别2.5%(以平均Sentence-BERT相似度衡量)。总体而言,HyMOR在所有评估数据集上的平均SBert提升23.2%,凸显其在多模态游戏内容生成与互动学习应用中实现精准感知的有效性。

关键词

引用

@article{arxiv.2604.16785,
  title  = {Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games},
  author = {Hanling Yi and Feng Lin and Mao Luo and Yifan Yang and Xiaotian Yu and Rong Xiao},
  journal= {arXiv preprint arXiv:2604.16785},
  year   = {2026}
}