重新审视视觉语言特征适应与社交媒体流行性预测中的不一致性
多媒体
2024-07-02 v1
摘要
社交媒体流行性(SMP)预测是一项涉及多模态数据集成的复杂任务。虽然深度学习模型已在医学影像和诊断中取得巨大进展,但其不透明的本质仍是临床应用和信任获得的挑战。在解释性方法中,概念基方法旨在提供任意分类器的简洁且易于人类理解的解释。然而,这些方法通常需要大量带有概念注释的手动收集数据,而在医学领域这类数据往往稀缺。本文提出了针对胸部X光的概念性反事实解释方法(CoCoX),该方法利用现有视觉语言模型(VLM)的联合嵌入空间来解释黑箱分类器的结果,无需注释数据集。具体而言,我们利用来自胸部放射学报告的文本概念以及预训练的胸部放射学VLM来解释三种常见的心胸解剖病变。我们展示了我们方法生成的解释在语义上具有意义,并且忠实于底层病变。
引用
@article{arxiv.2407.00556,
title = {Revisiting Vision-Language Features Adaptation and Inconsistency for Social Media Popularity Prediction},
author = {Chih-Chung Hsu and Chia-Ming Lee and Yu-Fan Lin and Yi-Shiuan Chou and Chih-Yu Jian and Chi-Han Tsai},
journal= {arXiv preprint arXiv:2407.00556},
year = {2024}
}
备注
Submission of the 7th Social Media Prediction Challenge