HKUST 在 SemEval-2023 任务 1 上的工作:结合上下文增强与视觉辅助的视觉词义消歧
计算机视觉与模式识别
2023-12-01 v1 多媒体
摘要
视觉词义消歧(VWSD)是一项多模态任务,旨在从一批候选图像中选出在有限上下文中最能蕴含目标词含义的一张。本文提出一种最大化利用预训练视觉-语言模型以及开放知识库与数据集的多模态检索框架。我们的系统由以下关键组件构成:(1)词义匹配:使用预训练双编码器模型将上下文与目标词的正确义项进行匹配;(2)提示构建:使用提示模板将匹配的词义及其他文本信息(如近义词)融入其中;(3)图像检索:以提示为查询从大型开放数据集中检索语义匹配图像;(4)模态融合:融合来自不同模态的上下文信息并用于预测。尽管我们的系统在 SemEval-2023 任务 1 上未产生最具竞争力的结果,我们仍击败了近半数队伍。更重要的是,我们的实验为该领域的词义消歧(WSD)与多模态学习揭示了敏锐的见解。我们的代码已在 GitHub 上公开。
引用
@article{arxiv.2311.18273,
title = {HKUST at SemEval-2023 Task 1: Visual Word Sense Disambiguation with Context Augmentation and Visual Assistance},
author = {Zhuohao Yin and Xin Huang},
journal= {arXiv preprint arXiv:2311.18273},
year = {2023}
}