中文

Augmenters 在 SemEval-2023 任务 1:通过提示增强与文本到图像扩散提升 CLIP 处理组合性与歧义性的零样本视觉词义消歧能力

计算与语言 2023-07-13 v1

摘要

本文描述了我们针对英语视觉词义消歧(VWSD)任务的零样本方法。我们的初步研究表明,使用 CLIP 将候选图像与短语进行匹配的简单方法受制于图像-文本对的多对多特性。我们发现 CLIP 文本编码器在捕捉自然语言中的组合性方面能力有限。反之,短语的描述焦点因实例而异。我们在两个系统 Augment-CLIP 和 Stable Diffusion 采样(SD Sampling)中解决了这些问题。Augment-CLIP 借助大语言模型(LLMs)生成包含上下文短语的句子,从而增强文本提示。我们进一步探索了其他语言中的 CLIP 模型,因为歧义词可能在另一种语言中被翻译为无歧义词。SD Sampling 使用文本到图像的 Stable Diffusion 从给定短语生成多张图像,增加了图像子集与配对文本图像相匹配的可能性。

关键词

引用

@article{arxiv.2307.05564,
  title  = {Augmenters at SemEval-2023 Task 1: Enhancing CLIP in Handling Compositionality and Ambiguity for Zero-Shot Visual WSD through Prompt Augmentation and Text-To-Image Diffusion},
  author = {Jie S. Li and Yow-Ting Shiue and Yong-Siang Shih and Jonas Geiping},
  journal= {arXiv preprint arXiv:2307.05564},
  year   = {2023}
}

备注

Proceedings of the 17th International Workshop on Semantic Evaluation (SemEval-2023)