中文

预测每周《纽约er》漫画的获胜标题

计算机视觉与模式识别 2024-07-30 v1 人工智能

摘要

图像标题生成使用 Vision Transformer (ViT) 代表了计算机视觉和自然语言处理交叉融合的关键节点,具有提升用户体验、改善可访问性以及为视觉数据提供文本表示的潜力。本文探讨了将图像标题生成技术应用于《纽约er》漫画的可能性,旨在生成模仿《纽约er》漫画标题竞赛获胜条目幽默风格的标题。这一任务需要 sophisticated 的视觉和语言处理能力,以及对文化细微差异和幽默的理解。我们提出了若干新基准方法,用于使用视觉 Transformer 编码器-解码器模型生成《纽约er》漫画标题竞赛的标题。

关键词

引用

@article{arxiv.2407.18949,
  title  = {Predicting Winning Captions for Weekly New Yorker Comics},
  author = {Stanley Cao and Sonny Young},
  journal= {arXiv preprint arXiv:2407.18949},
  year   = {2024}
}