中文

Text-RAG 和 Image-RAG 中的基于知识的学习

计算机视觉与模式识别 2026-01-14 v1 人工智能

摘要

本研究分析并比较了基于 Vision Transformer(EVA-ViT)的图像编码器与 LlaMA 或 ChatGPT LLM 的多模态方法,以减少幻觉问题并检测胸部 X 射线图像中的疾病。在本研究中,我们利用 NIH 胸部 X 射线图像训练模型,并在基于图像的 RAG、基于文本的 RAG 和基线中进行了比较。[3] [5] 结果表明,基于文本的 RAG[2] 通过使用外部知识信息有效减少了幻觉问题,而基于图像的 RAG 通过使用 KNN 方法提高了预测置信度和校准。[4] 此外,GPT LLM 表现出更好的性能、较低的幻觉率和更好的期望校准误差(ECE),优于基于 Llama 的模型。这项研究显示了数据不平衡、复杂多阶段结构的挑战,但提出了一个大型经验环境和平衡的使用示例。

关键词

引用

@article{arxiv.2601.08226,
  title  = {Knowledge-based learning in Text-RAG and Image-RAG},
  author = {Alexander Shim and Khalil Saieh and Samuel Clarke},
  journal= {arXiv preprint arXiv:2601.08226},
  year   = {2026}
}

备注

9 pages, 10 figures