OPI在SemEval 2023任务1上的工作:基于图像-文本嵌入与多模态信息检索的视觉词义消歧
计算与语言
2023-04-17 v1
摘要
视觉词义消歧的目标是找到与所给词语含义描述最匹配的图像。这是一个具有挑战性的问题,需要结合语言与图像理解的方法。本文介绍我们向SemEval 2023视觉词义消歧共享任务提交的系统。所提系统集成了多模态嵌入、学习排序方法以及基于知识的方法。我们基于CLIP模型构建了一个分类器,其结果通过从Wikipedia和词汇数据库检索的附加信息加以丰富。我们的方案在多语言任务中排名第三,并在波斯语赛道(三个语言子任务之一)中获胜。
引用
@article{arxiv.2304.07127,
title = {OPI at SemEval 2023 Task 1: Image-Text Embeddings and Multimodal Information Retrieval for Visual Word Sense Disambiguation},
author = {Sławomir Dadas},
journal= {arXiv preprint arXiv:2304.07127},
year = {2023}
}