中文

ControlCap:可控区域级描述生成

计算机视觉与模式识别 2024-03-12 v3

摘要

区域级描述生成面临描述退化问题的挑战,该问题指的是预训练多模态模型倾向于预测最频繁的描述,而遗漏了那些较少出现的描述。在本研究中,我们提出了一种可控区域级描述生成(ControlCap)方法,该方法将控制词引入多模态模型以解决描述退化问题。具体来说,ControlCap利用一个判别模块在描述空间内生成控制词,将其划分为多个子空间。多模态模型被约束在包含控制词的少数子空间内生成描述,这增加了命中较少出现描述的机会,从而缓解了描述退化问题。此外,交互式控制词可以由人类或专家模型给出,这使得描述生成能够超越训练描述空间,增强了模型的泛化能力。在Visual Genome和RefCOCOg数据集上的大量实验表明,ControlCap分别将CIDEr分数提高了21.6和2.2,以显著优势超越了最先进的方法。代码可在https://github.com/callsys/ControlCap获取。

关键词

引用

@article{arxiv.2401.17910,
  title  = {ControlCap: Controllable Region-level Captioning},
  author = {Yuzhong Zhao and Yue Liu and Zonghao Guo and Weijia Wu and Chen Gong and Fang Wan and Qixiang Ye},
  journal= {arXiv preprint arXiv:2401.17910},
  year   = {2024}
}

备注

https://github.com/callsys/ControlCap