中文

视觉遇见定义:融合词义信息的无监督视觉词义消歧

计算与语言 2023-07-25 v3 人工智能 计算机视觉与模式识别

摘要

视觉词义消歧(VWSD)是一项为给定上下文寻找最准确描绘目标词正确义项的图像的任务。此前,图文匹配模型常受限于多义词识别。本文引入一种利用外部词汇知识库(尤其是义项定义)中词义信息的无监督 VWSD 方法。具体而言,我们建议在未提供答案义项信息时,采用贝叶斯推断来融合义项定义。此外,为改善未登录词(OOD)问题,我们提出基于 GPT-3 的上下文感知定义生成。实验结果表明,采用我们基于贝叶斯推断的方法后 VWSD 性能显著提升。并且,我们的上下文感知定义生成在 OOD 样例上取得了突出性能改进,优于已有的定义生成方法。

关键词

引用

@article{arxiv.2305.01788,
  title  = {Vision Meets Definitions: Unsupervised Visual Word Sense Disambiguation Incorporating Gloss Information},
  author = {Sunjae Kwon and Rishabh Garodia and Minhwa Lee and Zhichao Yang and Hong Yu},
  journal= {arXiv preprint arXiv:2305.01788},
  year   = {2023}
}

备注

ACL 2023, https://aclanthology.org/2023.acl-long.88