基于频谱融合的量子增强医学视觉问答
计算机视觉与模式识别
2025-08-19 v1 人工智能
摘要
解决需要图像和文本理解能力的复杂临床问题是医疗 AI 中的一大挑战。本文提出 Q-FSRU 模型,将频谱表示与融合 (FSRU) 与量子检索增强生成 (Quantum RAG) 方法结合,用于医学视觉问答 (VQA)。该模型从医学图像和相关文本特征输入,将其转换到频域(通过快速傅里叶变换 FFT),有助于聚焦于更有意义的数据,滤除噪声或不够有用的信息。为提升准确度并确保答案基于真实知识,我们引入量子启发式检索系统。该系统使用基于量子的相似性技术从外部来源获取有用医学事实。这些细节随后与基于频率的特征融合,以实现更强的推理。我们使用包括真实放射学图像和问题的 VQA-RAD 数据集进行评估。结果表明,Q-FSRU 在需要图像-文本推理的复杂案例中超越了先前模型。频谱和量子信息的组合提升了性能和可解释性。总体而言,该方法为构建智能、清晰且对医生有帮助的 AI 工具提供了前景路径。
引用
@article{arxiv.2508.12036,
title = {Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering},
author = {Rakesh Thakur and Yusra Tariq},
journal= {arXiv preprint arXiv:2508.12036},
year = {2025}
}
备注
8 pages, 4 figures Submitted to AAAI 26