用于癌症实体关联与分类的机器学习方法
计算与语言
2023-06-27 v2 机器学习
摘要
根据世界卫生组织(WHO)的数据,癌症是全球第二大死因。关于不同类型癌症的科学研究以不断增长的速度发展,每年发表大量研究文章。与基因相关的药物、诊断、风险、症状、治疗等方面的洞察信息与知识,是有助于探索和推进癌症研究进展的重要因素。人工筛选如此大量的文章以形成任何假设非常费力且耗时。本研究使用两个最重要的NLP(自然语言处理)功能——实体识别和文本分类,从生物医学文献中发现知识。命名实体识别(NER)在用户友好界面和内置词典的支持下,从非结构化文本中识别并提取与癌症相关的预定义实体。文本分类有助于探索文本中的洞察信息,并简化数据分类、查询和文章筛选。机器学习分类器也用于构建分类模型,结构化查询语言(SQL)用于识别可能导致重要预测的隐藏关系。
引用
@article{arxiv.2306.00013,
title = {Machine Learning Approach for Cancer Entities Association and Classification},
author = {G. Jeyakodi and Arkadeep Pal and Debapratim Gupta and K. Sarukeswari and V. Amouda},
journal= {arXiv preprint arXiv:2306.00013},
year = {2023}
}
备注
This paper got accepted for paper presentation at the International Conference on Knowledge Discoveries on Statistical Innovations and Recent Advances in Optimization (ICON-KSRAO) on 29th and 30th December 2022