TRUST-VL:用于通用多模态错误信息检测的可解释新闻助手
计算机视觉与模式识别
2025-10-31 v2 多媒体
摘要
多模态错误信息涵盖文本、视觉和跨模态失真,构成了日益严重的社会威胁,且被生成式 AI 进一步放大。现有方法通常专注于单一类型的失真,且难以泛化到未见场景。在本工作中,我们观察到不同失真类型共享通用的推理能力,同时也需要特定任务的技能。我们假设跨失真类型的联合训练有助于知识共享并增强模型的泛化能力。为此,我们引入了 TRUST-VL,一个用于通用多模态错误信息检测的统一且可解释的视觉-语言模型。TRUST-VL 包含一个新颖的 Question-Aware Visual Amplifier 模块,旨在提取特定任务的视觉特征。为了支持训练,我们还构建了 TRUST-Instruct,这是一个包含 198K 样本的大规模指令数据集,具有与人类事实核查工作流对齐的结构化推理链。在领域内和零样本基准上的大量实验表明,TRUST-VL 实现了 SOTA 性能,同时提供了强大的泛化能力和可解释性。
引用
@article{arxiv.2509.04448,
title = {TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection},
author = {Zehong Yan and Peng Qi and Wynne Hsu and Mong Li Lee},
journal= {arXiv preprint arXiv:2509.04448},
year = {2025}
}
备注
EMNLP 2025 Oral; Project Homepage: https://yanzehong.github.io/trust-vl/