KGAlign:基于联合语义-结构知识编码的多模态假新闻检测
计算机视觉与模式识别
2025-10-20 v2 人工智能
计算与语言
摘要
假新闻检测因文本误导、人造图像及外部知识推理之间的复杂交互,仍是一项具有挑战性的任务。虽然已有方法在验证真实性和跨模态一致性方面取得了显著成果,但仍存在两个关键挑战:(1)现有方法通常仅考虑全局图像上下文,忽略局部对象级细节;(2)它们未能融合外部知识和实体关系,以实现更深入的语义理解。为此,我们提出一种新型多模态假新闻检测框架,集成视觉、文本和知识基表示。该方法利用底部注意力捕获细粒度对象细节,采用 CLIP 进行全局图像语义编码,采用 RoBERTa 进行上下文感知文本编码。我们进一步通过检索和自适应选择知识图谱中相关实体来增强知识利用。经融合的多模态特征经 Transformer 基分类器处理,用于预测新闻真实性。实验结果表明,我们的模型在最新方法上取得了优异性能,展示了邻居选择机制和多模态融合在假新闻检测中的有效性。我们的方案引入了一种新范式:以知识为基础的多模态推理。通过集成显式实体级选择和 NLI 指导过滤,我们将假新闻检测从特征融合转向语义导向的验证。为保证可重复性和进一步研究,源代码已公开于 \href{https://github.com/latuanvinh1998/KGAlign}{github.com/latuanvinh1998/KGAlign}。
引用
@article{arxiv.2505.14714,
title = {KGAlign: Joint Semantic-Structural Knowledge Encoding for Multimodal Fake News Detection},
author = {Tuan-Vinh La and Minh-Hieu Nguyen and Minh-Son Dao},
journal= {arXiv preprint arXiv:2505.14714},
year = {2025}
}
备注
Withdrawn by the authors due to lack of explicit agreement from all co-authors to post this version publicly on arXiv