中文

儿童早期教育中日常活动图像描述:基准数据集与算法

计算机视觉与模式识别 2026-04-03 v1 人工智能

摘要

儿童早期教育(ECE)的图像描述对于自动化活动理解和教育评估至关重要。然而,现有方法面临两个关键挑战:首先,缺乏大规模、领域特定的数据集限制了模型捕捉ECE场景下独特细粒度语义概念的能力,导致描述通用且不够精确;其次,常规训练范式在提升专业对象描述能力方面存在局限,监督学习倾向于优先高频表达,而强化学习在难样本上可能 suffer from 不稳定的优化。为此,我们引入ECAC(Early Childhood Education Captioning基准), comprising 256,121张标注了专家水平描述和细粒度标签的真实世界图像。ECAC还配备了教学玩具识别得分(TTS)作为领域导向的评估协议,以显式衡量专业对象命名准确性。进一步,我们提出RSRS(Reward-Conditional Switch of Reinforcement Learning and Supervised Fine-Tuning),一种动态在RL与监督优化之间交替的混合训练框架。通过将奖励为零的难样本重新路由到监督微调,RSRS有效缓解了优势崩溃,使细粒度识别获得稳定优化。依托ECAC和RSRS,我们开发了KinderMM-Cap-3B,这是一个领域适应的多模态大语言模型。大量实验表明,我们的模型在TTS上达到51.06,显著优于最先进的基线,同时保持卓越的描述质量,凸显其在专业教育应用中的潜力。

关键词

引用

@article{arxiv.2604.01941,
  title  = {Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm},
  author = {Sixing Li and Zhibin Gu and Ziqi Zhang and Weiguo Pan and Bing Li and Ying Wang and Hongzhe Liu},
  journal= {arXiv preprint arXiv:2604.01941},
  year   = {2026}
}