中文

Q-FSRU:基于量子增强的频谱-频率医学视觉问答

计算机视觉与模式识别 2025-10-06 v2

摘要

解决需要图像和文本理解才能完成的复杂临床问题是医疗 AI 中的重要挑战。本文提出 Q-FSRU,一种新型模型,将频谱表示与融合 (FSRU) 与量子检索增强生成 (Quantum RAG) 方法结合,用于医学视觉问答 (VQA)。该模型接收医学图像和相关文本特征,然后通过快速傅里叶变换 (FFT) 将其移至频域,从而能够聚焦于更有意义的数据并过滤噪声或不太有用信息。为提高准确性并确保答案基于真实知识,我们添加了一个受量子启发的检索系统。它使用基于量子的相似性技术从外部来源获取有用医学事实。这些细节随后与频率特征融合,以获得更强的推理能力。我们使用包括真实放射学图像和问题的 VQA-RAD 数据集进行评估。结果表明,Q-FSRU 在复杂需要图像文本推理的案例中优于先前模型。频谱和量子信息的组合提高了性能和可解释性。总体而言,这种方法为构建智能、清晰且对医生有帮助的 AI 工具提供了有前景的途径。

关键词

引用

@article{arxiv.2509.23899,
  title  = {Q-FSRU: Quantum-Augmented Frequency-Spectral For Medical Visual Question Answering},
  author = {Rakesh Thakur and Yusra Tariq and Rakesh Chandra Joshi},
  journal= {arXiv preprint arXiv:2509.23899},
  year   = {2025}
}

备注

12 pages (9 main + 2 references/appendix), 2 figures, conference paper submitted to ICLR 2026