基于混合马尔可夫逻辑网络的视觉字幕生成解释
计算机视觉与模式识别
2025-07-30 v1 人工智能
摘要
深度神经网络(DNN)在图像字幕生成等多模态任务中取得了巨大进展。然而,解释/阐释这些模型如何整合视觉信息、语言信息与知识表示以生成有意义的字幕,仍然是一项具有挑战性的问题。衡量性能的常规指标通常依赖于将生成的字幕与人工撰写的字幕进行比较,这可能无法为用户提供关于上述整合过程的深入洞察。在本工作中,我们开发了一种基于混合马尔可夫逻辑网络(HMLN)的新型可解释框架——HMLN 是一种能够将符号规则与实值函数相结合的语言——其中我们假设训练数据中的相关样本可能如何影响所观察字幕的生成。为此,我们学习训练样本上的 HMLN 分布,并在以生成样本为条件时推断这些样本上的分布变化,从而量化哪些样本可能为生成所观察字幕提供了更丰富的信息来源。我们在 Amazon Mechanical Turk 上针对多个 SOTA 字幕生成模型所生成字幕进行的实验,展示了我们所提解释的可解释性,并使我们能够沿可解释性维度对这些模型进行比较。
引用
@article{arxiv.2507.21246,
title = {On Explaining Visual Captioning with Hybrid Markov Logic Networks},
author = {Monika Shah and Somdeb Sarkhel and Deepak Venugopal},
journal= {arXiv preprint arXiv:2507.21246},
year = {2025}
}