中文

识别推文中的因果关系:基于深度学习的糖尿病相关推文(2017–2021)用例

计算与语言 2022-02-25 v4 人工智能 机器学习

摘要

目的:利用机器学习方法,我们旨在从患者报告的糖尿病相关推文中提取显式与隐式因果关联,并提供一个工具,从因果视角更好地理解糖尿病在线社区中分享的观点、感受与观察。材料与方法:我们收集了 2017 年 4 月至 2021 年 1 月间超过 3000 万条英文糖尿病相关推文。应用深度学习与自然语言处理方法聚焦于具有个人与情感内容的推文。我们手动标注了一个因果-推文数据集,并用于训练 1) 微调的 Bertweet 模型以检测含因果关联的因果句;2) 基于 BERT 特征的 CRF 模型以提取可能的因果关联。原因与结果以半监督方式聚类,并可视化于交互式因果网络中。结果:在不平衡数据集中,因果句的召回率为 68%。基于 BERT 特征的 CRF 模型在因果检测上优于微调 BERT 模型,宏召回率达 68%。由此得到 96,676 条含因果关联的句子。"Diabetes" 被识别为中心簇,其后为 "Death" 与 "Insulin"。胰岛素定价相关原因频繁与 "Death" 关联。结论:我们开发了一种新方法,利用基于 BERT 的架构检测因果句并识别糖尿病相关推文中表达的显式与隐式、单词与多词原因及相应结果,并以因果网络可视化。从社交媒体数据中提取真实生活中的患者报告结果的因果关联,为糖尿病研究提供了有用的补充信息源。

关键词

引用

@article{arxiv.2111.01225,
  title  = {Identifying causal relations in tweets using deep learning: Use case on diabetes-related tweets from 2017-2021},
  author = {Adrian Ahne and Vivek Khetan and Xavier Tannier and Md Imbessat Hassan Rizvi and Thomas Czernichow and Francisco Orchard and Charline Bour and Andrew Fano and Guy Fagherazzi},
  journal= {arXiv preprint arXiv:2111.01225},
  year   = {2022}
}

备注

6 Figures, 4 Tables