不浪费标记:利用生物医学视觉语言模型中的长上下文
材料科学
2025-10-07 v1 介观与纳米尺度物理
应用物理
摘要
视觉语言模型(VLMs)通常使用短文本窗口(<77 个标记)进行预训练,这迫使对长格式标题的截断。然而,大规模开源医学文献中显示,极大比例的标题长度超过 77 个标记。为此,我们研究了在生物医学标题上进行长格式预训练对 VLMs 影响的关键性,通过扩展 VLMS 中文本编码器的上下文长度。我们发现,更长的上下文(即使从长格式标题中获得额外监督)与更好的检索和分类性能相关。基于此发现,我们引入了 BIOMEDICA-LongCAP,一个包含 100 万图像-标题对的数据集,包含来自全文文章的上下文感知描述,提供更长且更丰富的文本监督。使用 BIOMEDICA-LongCAP,我们训练了 BMC-LongCLIP 模型,其文本编码器支持最高 512 个标记的窗口。我们的模型将上下文容量扩展了 6.6 倍,将标记浪费从 55% 降低至仅 2.2%。在长标题检索基准测试中,BMC-LongCLIP 在 Recall@1 上实现最高提升 30%,在分类平均提升 2%,同时收敛速度也更快。我们的结果表明,长上下文建模是推动生物医学 VLMS 发展的有前景的方向。
引用
@article{arxiv.2510.03977,
title = {A van der Waals material exhibiting room temperature broken inversion symmetry with ferroelectricity},
author = {Fabia F. Athena and Cooper A. Voigt and Mengkun Tian and Anjan Goswami and Emily Toph and Moses Nnaji and Fanuel Mammo and Brent K. Wagner and Sungho Jeon and Wenshan Cai and Eric M. Vogel},
journal= {arXiv preprint arXiv:2510.03977},
year = {2025}
}