中文

IDEA:通过在线多标签识别增加文本多样性用于视觉-语言预训练

计算机视觉与模式识别 2022-08-02 v2 机器学习

摘要

基于大规模图文对的视觉-语言预训练(VLP)已在多个领域展现出优越性能。然而,互联网上共现的图文对通常缺乏显式对齐信息,这对VLP而言是次优的。现有方法提出采用现成目标检测器以利用额外的图像标签信息。然而,目标检测器耗时且只能识别预定义的目标类别,限制了模型能力。受文本中包含不完整细粒度图像信息的观察启发,我们引入IDEA,即通过对VLP进行在线多标签识别来增加文本多样性。IDEA表明,从文本中提取的图像标签进行的多标签学习可在VLP期间联合优化。此外,IDEA可在线识别有价值的图像标签,以提供更显式的文本监督。综合实验表明,IDEA能以较小的额外计算成本在多个下游数据集上显著提升性能。

关键词

引用

@article{arxiv.2207.05333,
  title  = {IDEA: Increasing Text Diversity via Online Multi-Label Recognition for Vision-Language Pre-training},
  author = {Xinyu Huang and Youcai Zhang and Ying Cheng and Weiwei Tian and Ruiwei Zhao and Rui Feng and Yuejie Zhang and Yaqian Li and Yandong Guo and Xiaobo Zhang},
  journal= {arXiv preprint arXiv:2207.05333},
  year   = {2022}
}

备注

Accepted by the 30th ACM International Conference on Multimedia (ACM MM 2022)