面向不平衡数据的负孕期结局分类的数据增强
计算与语言
2025-12-30 v1 机器学习
摘要
婴儿死亡仍是美国的一个重大公共卫生问题,其中先天性畸形被 identified 为主要原因之一。尽管持续努力了解负面孕期结局(如流产、流产、先天性畸形和早产)的成因,但仍需要更全面的研究和干预策略。本文介绍了一种新方法,利用来自 Twitter 等公开可获取的社交媒体数据来增强当前用于研究负面孕期结局的数据集,通过观察性研究。社交媒体数据的本质挑战包括不平衡、噪声和缺乏结构, necessitates robust preprocessing techniques 和数据增强策略。通过构建自然语言处理 (NLP) 管道,我们旨在自动识别分享其孕期经历的女性,并根据报告的结局对其进行分类。报告完整孕周和正常出生体重的女性将被分类为阳性病例,而报告负面孕期结局的女性则被识别为阴性病例。此外,本研究的潜在应用包括评估特定干预措施、治疗或产前暴露对母婴健康结局的因果影响。它还为未来涉及孕妇队列和对照组的健康研究提供了框架。就更广泛的背景而言,我们的研究展示了将社交媒体数据作为流行病学调查中关于孕期结局的补充资源的可行性。
引用
@article{arxiv.2512.22732,
title = {Data Augmentation for Classification of Negative Pregnancy Outcomes in Imbalanced Data},
author = {Md Badsha Biswas},
journal= {arXiv preprint arXiv:2512.22732},
year = {2025}
}