中文

面向零样本图像字幕的大规模双向训练

计算机视觉与模式识别 2023-10-03 v3 计算与语言

摘要

当在大规模数据集上训练时,图像字幕模型能够理解通用领域图像的内容,但往往无法生成准确、详细的字幕。为提升性能,预训练—微调一直是图像字幕的关键策略。然而,我们发现图像与文本间的大规模双向训练能够实现零样本图像字幕。在本文中,我们介绍了 BITTERS(大规模双向图像文本训练,Bidirectional Image Text Training in largER Scale),一种用于零样本图像字幕的高效训练与推理框架。我们还提出了一个新的评测基准,包含高质量数据集和一组广泛的指标,以恰当评估零样本字幕准确性与社会偏见。此外,我们提供了一种高效的关键词提取微调方法。我们表明,谨慎选择大规模训练集与模型架构是实现零样本图像字幕的关键。

关键词

引用

@article{arxiv.2211.06774,
  title  = {Large-Scale Bidirectional Training for Zero-Shot Image Captioning},
  author = {Taehoon Kim and Mark Marsden and Pyunghwan Ahn and Sangyun Kim and Sihaeng Lee and Alessandra Sala and Seung Hwan Kim},
  journal= {arXiv preprint arXiv:2211.06774},
  year   = {2023}
}

备注

Arxiv Preprint. Work in progress