从一亿篇生物医学文献的知识综合增强冠状病毒受体的深度表达谱分析
基因组学
2020-03-31 v1 信息检索
生物大分子
组织与器官
摘要
COVID-19大流行要求吸收所有可用的生物医学知识以解码其致病与传播机制。尽管近期无监督神经网络在解码非结构化自然语言方面复兴,但一个用于实时综合呈指数增长的生物医学文献并其与深度组学洞察全面三角关联的的平台尚不可用。在此,我们提出nferX平台,用于从非结构化生物医学文本中提取的超过45千万亿种可能概念关联的动态推断,并将其与来自超过25种组织的单细胞RNA测序(Single Cell RNA-sequencing)洞察进行三角关联。利用该平台,我们识别出COVID-19的病理表现与SARS-CoV-2受体ACE2的综合表达谱之间的交集。我们发现舌角质形成细胞和嗅上皮细胞可能是被低估的SARS-CoV-2感染靶标,这与报道的味觉和嗅觉丧失作为COVID-19感染(包括在其他无症状患者中)早期指标相关。肺中的气道克拉拉细胞、纤毛细胞和II型肺泡细胞,以及肠道的肠上皮细胞也表达ACE2。本研究展示了整体数据科学平台如何利用前所未有的结构化与非结构化公开数据量来加速产生有影响力的生物学洞察与假设。
引用
@article{arxiv.2003.12773,
title = {Knowledge synthesis from 100 million biomedical documents augments the deep expression profiling of coronavirus receptors},
author = {AJ Venkatakrishnan and Arjun Puranik and Akash Anand and David Zemmour and Xiang Yao and Xiaoying Wu and Ramakrishna Chilaka and Dariusz K. Murakowski and Kristopher Standish and Bharathwaj Raghunathan and Tyler Wagner and Enrique Garcia-Rivera and Hugo Solomon and Abhinav Garg and Rakesh Barve and Anuli Anyanwu-Ofili and Najat Khan and Venky Soundararajan},
journal= {arXiv preprint arXiv:2003.12773},
year = {2020}
}
备注
5 figures