Med-MMHL:用于检测医疗领域人类与LLM生成错误信息的多模态数据集
社会与信息网络
2023-06-16 v1 计算机与社会
摘要
错误信息的普遍性影响对个人和社会具有深远且有害的效应。COVID-19大流行见证了医疗错误信息传播的惊人激增。然而,现有关于错误信息的数据集主要聚焦于文本信息,忽视视觉元素的纳入,且往往仅围绕COVID-19相关错误信息,忽略其他疾病的错误信息。此外,大型语言模型(LLM)如2022年底开发的ChatGPT在生成错误信息方面的潜力在先前工作中被忽视。为克服这些局限,我们提出Med-MMHL,一个涵盖多种疾病的一般医疗领域新型多模态错误信息检测数据集。Med-MMHL不仅包含人类生成的错误信息,还包括由ChatGPT等LLM生成的错误信息。我们的数据集旨在促进跨多种疾病及各类场景(包括句子、文档和多模态层面上的人类与LLM生成错误信息检测)的方法学研究与开发。访问我们的数据集与代码,请见GitHub仓库:\url{https://github.com/styxsys0927/Med-MMHL}。
引用
@article{arxiv.2306.08871,
title = {Med-MMHL: A Multi-Modal Dataset for Detecting Human- and LLM-Generated Misinformation in the Medical Domain},
author = {Yanshen Sun and Jianfeng He and Shuo Lei and Limeng Cui and Chang-Tien Lu},
journal= {arXiv preprint arXiv:2306.08871},
year = {2023}
}