S-Chain:医学视觉链式思考
机器学习
2025-10-28 v1 计算机视觉与模式识别
摘要
忠实的医学视觉语言模型(VLM)推理不仅需要准确的预测,还需要文本论证与视觉证据之间的透明对齐。虽然链式思考(CoT)提示在医学视觉问答(VQA)中显示出前景,但尚无大规模专家水平数据集能捕捉带有精确视觉锚定的逐步推理。我们提出S-Chain,这是首个包含12,000个专家标注医学图像的数据集,配备边界框和结构化视觉CoT(SV-CoT),显式将视觉区域链接到推理步骤。数据集进一步支持16种语言,总计超过70万对VQA,以实现广泛的多语言适用性。使用S-Chain,我们对最先进的医学VLM(ExGra-Med、LLaVA-Med)和通用VLM(Qwen2.5-VL、InternVL2.5)进行基准测试,发现SV-CoT监督显著提升可解释性、锚定忠实度和鲁棒性。除基准测试外,我们研究了其与检索增强生成的协同作用,揭示了领域知识和视觉锚定在自回归推理中的相互作用。最后,我们提出一种新机制加强视觉证据与推理之间的对齐,提高了可靠性和效率。S-Chain为医学推理建立了新基准,为通往更可信、更可解释的医学VLM之路。
引用
@article{arxiv.2510.22728,
title = {S-Chain: Structured Visual Chain-of-Thought For Medicine},
author = {Khai Le-Duc and Duy M. H. Nguyen and Phuong T. H. Trinh and Tien-Phat Nguyen and Nghiem T. Diep and An Ngo and Tung Vu and Trinh Vuong and Anh-Tien Nguyen and Mau Nguyen and Van Trung Hoang and Khai-Nguyen Nguyen and Hy Nguyen and Chris Ngo and Anji Liu and Nhat Ho and Anne-Christin Hauschild and Khanh Xuan Nguyen and Thanh Nguyen-Tang and Pengtao Xie and Daniel Sonntag and James Zou and Mathias Niepert and Anh Totti Nguyen},
journal= {arXiv preprint arXiv:2510.22728},
year = {2025}
}
备注
First version