中文

量子视觉词义消歧:通过量子推理模型解析歧义

量子物理 2026-01-01 v1 计算与语言

摘要

视觉词义消歧关注多义词,其候选图像容易混淆。传统方法使用经典概率计算图像与目标词每个释义匹配的可能性,并将这些可能性求和形成后验概率。然而,由于语义不确定性的挑战,不同来源的释义不可避免地带有语义偏差,这可能导致有偏的消歧结果。受量子叠加在建模不确定性方面的启发,本文提出了一种用于无监督视觉词义消歧的量子推理模型(Q-VWSD)。它将目标词的多个释义编码到叠加态中,以减轻语义偏差。然后,执行量子电路并观测结果。通过形式化我们的方法,我们发现 Q-VWSD 是基于经典概率方法的量子推广。在此基础上,我们进一步设计了一个启发式版本的 Q-VWSD,可以在经典计算上更高效地运行。实验表明,我们的方法优于最先进的经典方法,特别是通过有效利用来自大型语言模型的非专用释义,进一步提升了性能。我们的方法展示了量子机器学习在实际应用中的潜力,并为在量子硬件尚不成熟时在经典计算机上利用量子建模优势提供了一个案例。

关键词

引用

@article{arxiv.2512.24687,
  title  = {Quantum Visual Word Sense Disambiguation: Unraveling Ambiguities Through Quantum Inference Model},
  author = {Wenbo Qiao and Peng Zhang and Qinghua Hu},
  journal= {arXiv preprint arXiv:2512.24687},
  year   = {2026}
}