中文

HealthGPT:一种 医学 大型 视觉-语言 模型 用于 通过 异构 知识 适应 统一 理解 与 生成

计算机视觉与模式识别 2025-02-24 v3 人工智能

摘要

我们 提出 HealthGPT,一种 强大的 医学 大型 视觉-语言 模型 (Med-LVLM),其 集成 了 医学 视觉 理解 和 生成 能力,纳入 一个 统一 的 自回归 范式。我们的 引导 哲学 是:逐步 将 异构 的 理解 和 生成 知识 适应 于 预训练 的 大型 语言 模型 (LLM)。这 通过 一种 新的 异构低秩 适应 (H-LoRA) 技术 实现, 该 技术 伴随 一个 量身 定制 的 分层 视觉 感知 方法 和 一个 三阶段 学习 策略。为 有效 学习 HealthGPT,我们 设计 并 创建了一个 全面的 医学 领域 专门 的 理解 和 生成 数据集,称为 VL-Health。实验 结果 显示,HealthGPT 在 医学 视觉 统一 任务 中 表现 出色且 具 可扩展性。我们的 项目 可 在 https://github.com/DCDmllm/HealthGPT 查阅。

关键词

引用

@article{arxiv.2502.09838,
  title  = {HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation},
  author = {Tianwei Lin and Wenqiao Zhang and Sijing Li and Yuqian Yuan and Binhe Yu and Haoyuan Li and Wanggui He and Hao Jiang and Mengze Li and Xiaohui Song and Siliang Tang and Jun Xiao and Hui Lin and Yueting Zhuang and Beng Chin Ooi},
  journal= {arXiv preprint arXiv:2502.09838},
  year   = {2025}
}

备注

Comments: added project page