中文

发现病理解释与标记分配,以实现高效的多模态病理推理

计算机视觉与模式识别 2025-05-22 v1 人工智能

摘要

多模态病理图像理解因其整合视觉与文本数据以提升诊断准确性并实现个性化治疗的潜力而引起广泛关注。然而,现有方法表现有限的推理能力阻碍了其处理复杂诊断情景的能力。此外,病理图像的庞大尺寸导致严重的计算负担,进一步限制了其实际部署。为此,我们引入一种新型双向强化学习框架,包含两个协同分支。一个强化分支通过直接从标签中学习任务特定的决策过程(即病理解释),无需显式推理监督,从而提升推理能力。而另一个分支则根据视觉内容和任务上下文动态分配不同图像的合适标记数量,以优化计算效率。我们将该方法应用于各种病理任务,如视觉问答、癌症亚型划分和病灶检测。大量实验表明,与基础模型相比,性能提升平均达41.7个绝对值,推理成本降低70.3%,在推理准确性和计算效率之间实现了平衡。

关键词

引用

@article{arxiv.2505.15687,
  title  = {Discovering Pathology Rationale and Token Allocation for Efficient Multimodal Pathology Reasoning},
  author = {Zhe Xu and Cheng Jin and Yihui Wang and Ziyi Liu and Hao Chen},
  journal= {arXiv preprint arXiv:2505.15687},
  year   = {2025}
}