中文

利用大型语言模型识别考虑戒烟的 Reddit 用户以进行数字干预

信息检索 2024-04-30 v1 人工智能 计算与语言 机器学习 社会与信息网络

摘要

全球社交媒体平台的广泛普及不仅增强了用户的连通性与交流,也成为传播健康相关信息的重要渠道,从而使社交媒体数据成为公共卫生研究中极具价值的自然数据资源。美国及其他国家电子烟使用或吸电子烟行为的流行引发了电子烟相关肺损伤(EVALI)的爆发,导致 2019 年出现住院和死亡病例,这凸显了理解吸电子烟行为并制定有效戒烟策略的紧迫性。在本研究中,我们从 Reddit 上的一个电子烟子社区提取了一个样本数据集,以分析用户的戒烟意向。本研究利用包括最新 GPT-4 和传统基于 BERT 的语言模型在内的大型语言模型,执行句子级别的戒烟意向预测任务,并将这些模型的结果与人工标注进行比较。值得注意的是,与人工评估员相比,GPT-4 模型在遵循标注指南和流程方面表现出更高的一致性,展现出检测人工评估员可能忽略的细微用户戒烟意向的先进能力。这些初步发现强调了 GPT-4 在提升社交媒体数据分析准确性和可靠性方面的潜力,尤其是在识别人类难以察觉的细微用户意向方面。

关键词

引用

@article{arxiv.2404.17607,
  title  = {Utilizing Large Language Models to Identify Reddit Users Considering Vaping Cessation for Digital Interventions},
  author = {Sai Krishna Revanth Vuruma and Dezhi Wu and Saborny Sen Gupta and Lucas Aust and Valerie Lookingbill and Caleb Henry and Yang Ren and Erin Kasson and Li-Shiun Chen and Patricia Cavazos-Rehg and Dian Hu and Ming Huang},
  journal= {arXiv preprint arXiv:2404.17607},
  year   = {2024}
}