解码数据生成团队的模式:从 Bridge2AI 人才知识图谱获得临床与科研成功的洞见
数字图书馆
2025-01-20 v1
摘要
高质量的生物医学数据集是医学研究和疾病治疗创新的关键。NIH 资助的 Bridge2AI 项目致力于通过联合顶尖且多样化的团队来策划数据集,以支持以 AI 为驱动的生物医学研究。我们检查了来自 Nucleic Acids Research(NAR)数据库问题中的 1,699 个数据集论文以及 Bridge2AI 人才知识图谱。通过将每篇论文的作者视为一个团队,我们探讨了团队属性(团队权力和公平性)与数据集论文质量之间的关系,后者通过科学影响力(相对引文比率百分位)和临床转化潜力(APT,可能被临床试验和指南引用的 likelihood)来衡量。利用 SHAP 可解释 AI 框架,我们确定了团队属性与数据集论文在引文影响力和临床转化方面的成功之间的相关性。关键发现表明:(1) 主任研究员(PI)领导和团队学术实力是数据集成功的强预测因子;(2) 团队规模和职业年龄与科学影响力呈正相关,但在临床转化方面呈现相反模式;(3) 女性代表身份更高与数据集成功更相关。尽管我们的发现具有相关性,但它们为组建高绩效数据生成团队提供了宝贵的见解。未来的研究应纳入因果框架,以深化对这些关系的理解。
引用
@article{arxiv.2501.09897,
title = {Decoding Patterns of Data Generation Teams for Clinical and Scientific Success: Insights from the Bridge2AI Talent Knowledge Graph},
author = {Jiawei Xu and Qingnan Xie and Meijun Liu and Zhandos Sembay and Swathi Thaker and Pamela Payne-Foster and Jake Chen and Ying Ding},
journal= {arXiv preprint arXiv:2501.09897},
year = {2025}
}
备注
Accepted by JCDL 2024