比较 GPT-4 与开源语言模型在虚假信息缓解中的表现
计算与语言
2024-01-17 v1
摘要
近期研究表明,大型语言模型(LLMs)在虚假信息检测方面效果显著。然而,不同实验所选用的 LLM 差异很大,导致结论存在不确定性。特别是,GPT-4 在该领域表现强劲,但它是闭源的、可能成本高昂,且在不同版本间可能表现出不稳定性。与此同时,其他替代 LLM 的结果则好坏参半。在本工作中,我们表明 Zephyr-7b 提供了一个持续可行的替代方案,克服了 Llama-2 和 GPT-3.5 等常用方法的关键局限性。这为研究社区提供了一个可靠的开源选项,并表明开源模型在此任务上正逐渐迎头赶上。随后,我们着重指出 GPT-3.5 表现出不稳定的性能,以至于这个被广泛使用的模型可能在虚假信息检测中提供误导性结果。最后,我们验证了包括结构化输出方法和最新版 GPT-4 (Turbo) 在内的新工具,表明它们不会损害性能,从而为未来研究解锁了这些工具,并可能为虚假信息缓解构建更复杂的流程。
引用
@article{arxiv.2401.06920,
title = {Comparing GPT-4 and Open-Source Language Models in Misinformation Mitigation},
author = {Tyler Vergho and Jean-Francois Godbout and Reihaneh Rabbany and Kellin Pelrine},
journal= {arXiv preprint arXiv:2401.06920},
year = {2024}
}