中文

OPI在SemEval 2023任务1上的工作:基于图像-文本嵌入与多模态信息检索的视觉词义消歧

计算与语言 2023-04-17 v1

摘要

视觉词义消歧的目标是找到与所给词语含义描述最匹配的图像。这是一个具有挑战性的问题,需要结合语言与图像理解的方法。本文介绍我们向SemEval 2023视觉词义消歧共享任务提交的系统。所提系统集成了多模态嵌入、学习排序方法以及基于知识的方法。我们基于CLIP模型构建了一个分类器,其结果通过从Wikipedia和词汇数据库检索的附加信息加以丰富。我们的方案在多语言任务中排名第三,并在波斯语赛道(三个语言子任务之一)中获胜。

关键词

引用

@article{arxiv.2304.07127,
  title  = {OPI at SemEval 2023 Task 1: Image-Text Embeddings and Multimodal Information Retrieval for Visual Word Sense Disambiguation},
  author = {Sławomir Dadas},
  journal= {arXiv preprint arXiv:2304.07127},
  year   = {2023}
}