MMIDR:通过知识蒸馏教导大语言模型解释多模态错误信息
计算与语言
2024-04-09 v3
摘要
多模态错误信息的自动检测近来受到广泛关注。然而,强大的大语言模型(LLMs)在多模态错误信息检测方面的潜力仍未得到充分探索。此外,如何以经济高效且易于获取的方式教导大语言模型解释多模态错误信息仍是一个悬而未决的问题。为此,我们提出了MMIDR,一个旨在教导大语言模型为其多模态错误信息决策过程提供流畅且高质量文本解释的框架。为了将多模态错误信息转换为合适的指令遵循格式,我们提出了一个数据增强视角及其流水线。该流水线包含一个视觉信息处理模块和一个证据检索模块。随后,我们利用处理后的内容提示闭源大语言模型,以提取用于解释多模态错误信息真实性的依据。此外,我们设计了一种高效的知识蒸馏方法,将闭源大语言模型解释多模态错误信息的能力蒸馏到开源大语言模型中。为了探究关于大语言模型在多模态错误信息检测任务中表现的若干研究问题,我们构建了一个指令遵循的多模态错误信息数据集,并进行了全面的实验。实验结果表明,我们的MMIDR展现出充分的检测性能,并具备提供令人信服的依据来支持其评估的能力。
引用
@article{arxiv.2403.14171,
title = {MMIDR: Teaching Large Language Model to Interpret Multimodal Misinformation via Knowledge Distillation},
author = {Longzheng Wang and Xiaohan Xu and Lei Zhang and Jiarui Lu and Yongxiu Xu and Hongbo Xu and Minghao Tang and Chuang Zhang},
journal= {arXiv preprint arXiv:2403.14171},
year = {2024}
}
备注
10 pages, 3 figures