BioKlustering:面向极度不平衡基因组数据半监督学习的网络应用
基因组学
2024-12-17 v3 应用统计
摘要
摘要:从基因组序列中准确预测表型是生物学与医学研究中备受渴求的任务。尽管机器学习为多个领域的精准预测提供了关键手段,但生物数据的复杂性常使许多方法难以适用。我们推出 BioKlustering,这是一款用户友好、开源且公开可用的网络应用,专用于无监督与半监督学习,适用于无法对所有类别进行序列比对和/或实验表型测定的情形。其主要优势包括:1) 支持部分观测标签的极度不平衡设定,甚至仅观测到单一类别的情况,而目前大多数半监督方法禁止此类情形;2) 以未比对序列作为输入,从而可对病毒与细菌等差异极大(无法比对)的序列进行学习;3) 对几乎无编程基础者亦易于使用;4) 在小样本量下表现良好。可用性与实现:BioKlustering (https://bioklustering.wid.wisc.edu) 是一款免费可用的网络应用,基于 Python 框架 Django 实现,支持所有主流浏览器。该应用无需安装,且公开可用、开源 (https://github.com/solislemuslab/bioklustering)。
引用
@article{arxiv.2209.11730,
title = {BioKlustering: a web app for semi-supervised learning of maximally imbalanced genomic data},
author = {Samuel Ozminkowski and Yuke Wu and Hailey Bruzzone and Liule Yang and Zhiwen Xu and Luke Selberg and Chunrong Huang and Helena Jaramillo-Mesa and Claudia Solis-Lemus},
journal= {arXiv preprint arXiv:2209.11730},
year = {2024}
}