桥接词汇歧义与视觉:视觉词义消歧 Mini Review
计算与语言
2026-02-03 v1 计算机视觉与模式识别
摘要
本文对视觉词义消歧(Visual Word Sense Disambiguation, VWSD)进行了一次精简综述。VWSD 是传统词义消歧(Word Sense Disambiguation, WSD)的一种多模态扩展,旨在解决视觉语言任务中的词汇歧义问题。虽然传统 WSD 仅依赖文本和词汇资源,而 VWSD 则利用视觉线索,在最少的文本输入下寻找模糊词语的正确含义。本综述回顾了从早期的多模态融合方法到新兴框架的发展,这些框架利用对比模型(如 CLIP)、扩散式文本到图像生成以及大型语言模型(LLM)支持。我们检阅了2016至2025年的研究,展示了 VWSD 通过特征基方法、图基方法和对比嵌入技术的发展。本文聚焦于提示工程、微调以及多语言适应。定量结果表明,基于 CLIP 的微调模型和 LLM-enhanced VWSD 系统 consistently 优于零样基线,平均倒数排名(MRR)提升了最高可达6-8%。然而,挑战仍然存在,包括上下文限制、模型偏向常见含义、缺乏多语言数据集,以及需要更佳的评估框架。分析表明,CLIP 对齐、扩散生成与 LLM 推理的日益重合,正成为构建强大、具上下文感知能力且支持多语言消歧系统的未来之路。
引用
@article{arxiv.2602.01193,
title = {Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation},
author = {Shashini Nilukshi and Deshan Sumanathilaka},
journal= {arXiv preprint arXiv:2602.01193},
year = {2026}
}
备注
2 figures, 2 Tables, Accepted at IEEE TIC 2026