基于视觉语言引导和状态空间建模的生物医学出版物图像不当行为驳回
计算机视觉与模式识别
2026-01-14 v1
摘要
生物医学出版物中的科学图像操纵正成为威胁研究完整性和可重复性的趋势。与自然图像取证不同,生物医学伪造检测因特定领域的artifact、复杂纹理和非结构化图表布局而独特且具挑战性。我们提出了首个针对生物医学图像伪造的视觉语言引导框架,实现生成与检测双重功能。通过将基于扩散的合成与视觉语言提示相结合,本方法可实现跨多种生物医学模态的真实且语义受控的操纵,包括重复、拼接和区域移除。我们引入Rescind,一个大规模基准数据集,包含细粒度标注和模态特定划分,并提出Integscan,一个集成注意力增强视觉编码与提示条件语义对齐的结构化状态空间建模框架,用于精确伪造定位。为确保语义一致性,我们采用基于视觉语言模型的验证循环,对生成的伪造图像进行筛选,确保其与预期提示保持一致。在Rescind及现有基准上的大量实验表明,Integscan在检测和定位方面均实现了最先进水平,为自动化科学完整性分析奠定了坚实基础。
引用
@article{arxiv.2601.08040,
title = {Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling},
author = {Soumyaroop Nandi and Prem Natarajan},
journal= {arXiv preprint arXiv:2601.08040},
year = {2026}
}