面向病理视觉语言分析的低成本指令学习
人工智能
2025-06-23 v2 计算与语言
计算机视觉与模式识别
摘要
视觉语言模型的兴起促进了 AI 模型与人类之间的交互式对话。然而将这些模型应用于临床实践必须应对大规模训练数据、财务和计算资源方面的巨大挑战。本文提出一种名为 CLOVER 的病理对话式指令学习框架,以实现成本效益。CLOVER 仅训练轻量级模块,在冻结大型语言模型参数的同时进行指令调优。与使用高成本 GPT-4 不同,我们在 GPT-3.5 上设计良好提示以构建基于生成的指令,强调来自互联网来源的病理学知识的实用性。为增强指令的使用,我们构建了数字病理学情境下的高质量模板化指令集合。通过两个基准数据集的实验,我们揭示了混合形式指令在病理视觉问答中的优势。广泛的结果表明,CLOVER 在回答开放式和封闭式问题时具有成本效益,其中 CLOVER 的性能优于那些拥有 37 倍训练参数且使用来自 GPT-4 生成的指令数据的强大基线。通过指令调优,CLOVER 在外部临床数据集上展现出少样学习的鲁棒性。这些发现表明,CLOVER 的成本效益建模可加速其在数字病理学图景中实现快速对话应用的采用。
引用
@article{arxiv.2407.17734,
title = {Cost-effective Instruction Learning for Pathology Vision and Language Analysis},
author = {Kaitao Chen and Mianxin Liu and Fang Yan and Lei Ma and Xiaoming Shi and Lilong Wang and Xiaosong Wang and Lifeng Zhu and Zhe Wang and Mu Zhou and Shaoting Zhang},
journal= {arXiv preprint arXiv:2407.17734},
year = {2025}
}