中文

迷失在翻译中:语言如何为跨物种病理学重新对齐视觉

计算机视觉与模式识别 2026-03-06 v1 人工智能 机器学习

摘要

基础模型越来越多地应用于计算病理学,然而它们在跨癌种和跨物种迁移下的行为仍未明确。本研究调查了使用犬类和人类组织病理学的全切片图像块,在相同癌种、跨癌种和跨物种条件下,微调CPath-CLIP如何影响癌症检测。性能通过受试者工作特征曲线下面积(AUC)来衡量。少样本微调提高了相同癌种(AUC从64.9%到72.6%)和跨癌种性能(AUC从56.84%到66.31%)。跨物种评估揭示,虽然组织匹配实现了有意义的迁移,但性能仍低于最先进的基准(H-optimus-0:84.97% AUC),表明标准的视觉-语言对齐对于跨物种泛化是次优的。嵌入空间分析揭示了肿瘤和正常原型之间极高的余弦相似度(大于0.99)。Grad-CAM显示基于原型的模型仍受限于领域,而语言引导的模型则关注保守的肿瘤形态。为解决此问题,我们引入了语义锚定,它利用语言为视觉特征提供稳定的坐标系。消融研究表明,收益源于文本对齐机制本身,而与文本编码器的复杂度无关。与H-optimus-0的基准测试表明,CPath-CLIP的失败源于内在的嵌入坍塌,而文本对齐有效地规避了这一点。在相同癌种(8.52%)和跨癌种分类(5.67%)中观察到了额外的增益。我们识别出一种先前未被表征的失败模式:由物种主导的对齐而非缺失的视觉信息驱动的语义坍塌。这些结果表明,语言充当了一种控制机制,能够在无需重新训练的情况下实现语义重新解释。

关键词

引用

@article{arxiv.2603.04405,
  title  = {Lost in Translation: How Language Re-Aligns Vision for Cross-Species Pathology},
  author = {Ekansh Arora},
  journal= {arXiv preprint arXiv:2603.04405},
  year   = {2026}
}

备注

27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology