基于双通道文本提示和图像增强的 CLIP 可视化词义消歧
计算与语言
2026-02-09 v1
摘要
歧义性是大语言模型(LLMs)中天然语言理解持续面临的挑战。为更好地理解如何通过视觉领域消解词汇歧义,我们发展了可解释的可视化词义消歧(VWSD)框架。该模型利用 CLIP 将模糊语言和候选图像投影到共享的多模态空间中。我们通过包含 WordNet 同义词的语义通道和照片基准通道的双通道集成丰富文本嵌入,同时通过稳健的测试时增强来细化图像嵌入。随后我们使用余弦相似度确定与模糊文本最吻合的图像。评估于 SemEval-2023 VWSD 数据集时,丰富嵌入后 MRR 从 0.7227 提升至 0.7590,Hit Rate 从 0.5810 提升至 0.6220。消融研究表明,双通道提示提供了强大的低延迟性能,而激进的图像增强仅产生边际收益。额外实验表明,WordNet 定义和多语言提示集成进一步表明,噪声外部信号倾向于稀释语义特异性,强化了针对视觉词义消歧使用精确、CLIP 对齐提示的有效性。
引用
@article{arxiv.2602.06799,
title = {Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations},
author = {Shamik Bhattacharya and Daniel Perkins and Yaren Dogan and Vineeth Konjeti and Sudarshan Srinivasan and Edmon Begoli},
journal= {arXiv preprint arXiv:2602.06799},
year = {2026}
}
备注
9 pages, 6 figures, pending journal/workshop submission