大语言模型可在社交媒体上消除阿片俚语歧义
计算与语言
2026-03-12 v1
摘要
社交媒体文本在监测阿片过量危机方面显示出潜力;然而,绝大多数社交媒体文本与阿片无关。当利用社交媒体文本监测正在进行的阿片过量危机时,常用的识别相关内容策略是将阿片相关术语词典作为包含标准。然而,许多阿片俚语术语,如“smack”或“blues”,在非阿片含义下也很常见,导致这些术语具有歧义性。大语言模型 (LLM) 的先进文本推理能力为按比例消除这些俚语歧义提供了机会。我们在三个任务上对四个最先进的 LLM (GPT-4、GPT-5、Gemini 2.5 Pro 和 Claude Sonnet 4.5)进行评估:词典设置,即 LLM 必须在给定帖子的上下文中消除特定术语;无词典设置,即 LLM 必须在没有词典的情况下从上下文中识别阿片相关帖子;以及新兴俚语设置,即 LLM 必须识别带有模拟新俚语术语的阿片相关帖子。所有四个 LLM 在所有任务上表现优异。在词典设置的两个子任务中,LLM F1 分数(“fenty”子任务:0.824-0.972;“smack”子任务:0.540-0.862)远高于最佳词典策略(分别为 0.126 和 0.009)。在无词典任务中,LLM F1 分数(0.544-0.769)超过了词典(0.080-0.540),且 LLM 显示出一致的更高召回率。在新兴俚语上,所有 LLM 的准确率(平均值:0.784)、F1 分数(平均值:0.712)、精确率(平均值:0.981)和召回率(平均值:0.587)均高于评估的两个词典。我们的结果表明,LLM 可用于识别低流行主题的相关内容,包括但不限于阿片引用,增强提供给下游分析和预测模型的数据。
引用
@article{arxiv.2603.10313,
title = {Large language models can disambiguate opioid slang on social media},
author = {Kristy A. Carpenter and Issah A. Samori and Mathew V. Kiang and Keith Humphreys and Anna Lembke and Johannes C. Eichstaedt and Russ B. Altman},
journal= {arXiv preprint arXiv:2603.10313},
year = {2026}
}