中文

抓得住我吗:利用基于生成式预训练 Transformer 的大语言模型识别虚假医师评论

计算与语言 2023-04-21 v1 人工智能

摘要

虚假医生评论的泛滥对患者福祉具有潜在危害,并引发了消费者保护团体和监管机构的关注。然而尽管机器学习和自然语言处理领域取得重大进展,对虚假与真实评论差异特征的理解仍然有限。本研究利用一个包含 38048 条医师评论的新型预标注数据集,确立大语言模型在评论分类中的有效性。具体而言,我们将传统 ML 模型(如逻辑回归和支持向量机)与生成式预训练 Transformer 模型的表现进行比较。此外,我们使用 GPT 家族最新模型 GPT4 来揭示虚假与真实医师评论差异的关键维度。我们的结果显示,在此背景下 GPT-3 显著优于传统 ML 模型。另外,分析表明 GPT3 所需训练样本少于传统模型,说明其适用于训练数据稀缺的任务。而且,GPT3 的性能优势在冷启动情境(即某医生无历史评论时)进一步增强。最后,我们采用 GPT4 揭示区分虚假医师评论的关键维度。与文献中基于模拟数据所得的先前发现形成鲜明对比,我们基于真实世界数据集的发现表明:虚假评论通常比真实评论具有更多临床细节、更克制情感,且结构和语法更好。

关键词

引用

@article{arxiv.2304.09948,
  title  = {Catch Me If You Can: Identifying Fraudulent Physician Reviews with Large Language Models Using Generative Pre-Trained Transformers},
  author = {Aishwarya Deep Shukla and Laksh Agarwal and Jie Mein and Goh and Guodong and Gao and Ritu Agarwal},
  journal= {arXiv preprint arXiv:2304.09948},
  year   = {2023}
}