用于可解释隐私分类的图像引导主题建模
计算机视觉与模式识别
2025-08-29 v1
摘要
以人类可理解的术语预测并解释图像中包含的隐私信息是一项复杂且依赖上下文的任务。即使对大型语言模型而言,该任务也颇具挑战。为便于理解隐私决策,我们提出基于一组自然语言内容描述符来预测图像隐私。这些内容描述符与反映人们如何感知图像内容的隐私分数相关联。我们通过新颖的图像引导主题建模(ITM)方法生成描述符。ITM 通过多模态对齐,同时利用了视觉信息和来自视觉语言模型的图像文本描述。我们使用 ITM 生成的描述符来学习隐私预测器 PrivITM,其决策在设计上是可解释的。我们的 PrivITM 分类器在准确率上比参考的可解释方法高出 5 个百分点,并且与当前不可解释的 SOTA 模型性能相当。
引用
@article{arxiv.2409.18674,
title = {Image-guided topic modeling for interpretable privacy classification},
author = {Alina Elena Baia and Andrea Cavallaro},
journal= {arXiv preprint arXiv:2409.18674},
year = {2025}
}
备注
Paper accepted at the eXCV Workshop at ECCV 2024. Supplementary material included. Code available at https://github.com/idiap/itm