RMDM:用于越南语证据核验的多标签假新闻数据集
计算与语言
2023-09-19 v1 人工智能
摘要
在本研究中,我们提出一个新颖且具有挑战性的多标签越南语数据集(RMDM),旨在评估大语言模型(LLMs)在核验与法律语境相关的电子信息方面的性能,重点关注作为电子证据潜在输入的假新闻。RMDM数据集包含四个标签:real、mis、dis和mal,分别代表真实信息、误传信息、虚假信息和恶意信息。通过纳入这些多样化标签,RMDM捕捉了不同假新闻类别的复杂性,并揭示了不同语言模型处理可能作为电子证据组成部分的各类信息的能力。该数据集共包含1556个样本,每个标签389个样本。使用基于GPT和基于BERT的模型在数据集上的初步测试揭示了模型在不同标签上性能的差异,表明该数据集有效挑战了各类语言模型核验此类信息真实性的能力。我们的发现表明,核验包括假新闻在内的法律语境相关电子信息对语言模型而言仍属难题,亟需研究界进一步关注以推进面向潜在法律应用的更可靠AI模型。
引用
@article{arxiv.2309.09071,
title = {RMDM: A Multilabel Fakenews Dataset for Vietnamese Evidence Verification},
author = {Hai-Long Nguyen and Thi-Kieu-Trang Pham and Thai-Son Le and Tan-Minh Nguyen and Thi-Hai-Yen Vuong and Ha-Thanh Nguyen},
journal= {arXiv preprint arXiv:2309.09071},
year = {2023}
}
备注
ISAILD@KSE 2023