预测每周《纽约er》漫画的获胜标题
计算机视觉与模式识别
2024-07-30 v1 人工智能
摘要
图像标题生成使用 Vision Transformer (ViT) 代表了计算机视觉和自然语言处理交叉融合的关键节点,具有提升用户体验、改善可访问性以及为视觉数据提供文本表示的潜力。本文探讨了将图像标题生成技术应用于《纽约er》漫画的可能性,旨在生成模仿《纽约er》漫画标题竞赛获胜条目幽默风格的标题。这一任务需要 sophisticated 的视觉和语言处理能力,以及对文化细微差异和幽默的理解。我们提出了若干新基准方法,用于使用视觉 Transformer 编码器-解码器模型生成《纽约er》漫画标题竞赛的标题。
引用
@article{arxiv.2407.18949,
title = {Predicting Winning Captions for Weekly New Yorker Comics},
author = {Stanley Cao and Sonny Young},
journal= {arXiv preprint arXiv:2407.18949},
year = {2024}
}