中文

ConZIC:基于采样打磨的可控零样本图像描述生成

计算机视觉与模式识别 2023-03-10 v2

摘要

零样本能力已被视为深度学习的新革命,使机器能够在没有精心整理的训练数据的情况下处理任务。作为良好的开端也是零样本图像描述生成 (IC) 唯一已有的成果,ZeroCap 放弃了监督训练,并利用大规模预训练模型的知识按顺序搜索描述中的每一个词。尽管有效,其自回归生成和梯度导向搜索机制分别限制了描述的多样性和推理速度。此外,ZeroCap 未考虑零样本 IC 的可控性问题。为向前推进,我们提出了一种用于可控零样本 IC 的框架,名为 ConZIC。ConZIC 的核心是一个名为 GibbsBERT 的基于采样的非自回归语言模型,其可生成并持续打磨每一个词。大量定量与定性结果表明,我们提出的 ConZIC 在零样本 IC 和可控零样本 IC 上均具有优越性能。特别地,ConZIC 的生成速度比 ZeroCap 快约 5 倍,多样性分数约高 1.5 倍,且在不同控制信号下均能准确生成。

关键词

引用

@article{arxiv.2303.02437,
  title  = {ConZIC: Controllable Zero-shot Image Captioning by Sampling-Based Polishing},
  author = {Zequn Zeng and Hao Zhang and Zhengjue Wang and Ruiying Lu and Dongsheng Wang and Bo Chen},
  journal= {arXiv preprint arXiv:2303.02437},
  year   = {2023}
}

备注

Accepted by CVPR2023