CALBC RDF 三元组存储:对大规模文献内容的检索
数字图书馆
2010-12-09 v1 数据库
摘要
将科学文献整合到生物医学研究基础设施中需要处理文献、识别其中包含的命名实体和概念,并以标准化方式表示内容。CALBC 项目合作伙伴通过协调来自自动文本挖掘解决方案的注释(银标准语料库),生成了一个大规模带注释的生物医学语料库,包含四个不同的语义组。这四个语义组是化学实体和药物、基因和蛋白质、疾病和病症以及物种。SSC 的内容已完全集成到 RDF 三元组存储(4,568,678 个三元组)中,并与 GeneAtlas(182,840 个三元组)、UniProtKb(人类 12,552,239 个三元组)和词汇资源 LexEBI(BioLexicon)的内容对齐。RDF 三元组存储能够同时查询科学文献和生物信息学资源,以寻找遗传原因的证据,例如药物靶点和疾病关联。
引用
@article{arxiv.1012.1650,
title = {The CALBC RDF Triple Store: retrieval over large literature content},
author = {Samuel Croset and Christoph Grabmüller and Chen Li and Silvestras Kavaliauskas and Dietrich Rebholz-Schuhmann},
journal= {arXiv preprint arXiv:1012.1650},
year = {2010}
}
备注
in Adrian Paschke, Albert Burger, Andrea Splendiani, M. Scott Marshall, Paolo Romano: Proceedings of the 3rd International Workshop on Semantic Web Applications and Tools for the Life Sciences, Berlin,Germany, December 8-10, 2010