中文

小规模和异质性生物数据集中的领域自适应

定量方法 2024-05-30 v1 机器学习

摘要

机器学习技术在现代生物学中日益重要,用于构建预测模型、发现模式和研究生物学问题。然而,由于不同数据集统计属性的差异,在一个数据集上训练的模型通常无法推广到来自不同队列或实验室的其他数据集。这些差异可能源于技术差异(如使用的测量技术)或研究人群之间的相关生物学差异。领域自适应作为一种迁移学习,可以通过对齐不同数据集之间特征和样本的统计分布来缓解这一问题,从而使相似模型能够跨数据集应用。然而,大多数最先进的领域自适应方法设计用于大规模数据(主要是文本和图像),而生物数据集通常样本量小,且具有特征空间异质性等复杂性。本综述旨在综合讨论小规模和高度异质性生物数据背景下的领域自适应方法。我们描述了领域自适应在生物学研究中的优势和挑战,并通过关键代表性方法批判性地讨论其一些目标、优势和劣势。我们主张将领域自适应技术纳入计算生物学家的工具箱,并进一步开发定制方法。

关键词

引用

@article{arxiv.2405.19221,
  title  = {Domain adaptation in small-scale and heterogeneous biological datasets},
  author = {Seyedmehdi Orouji and Martin C. Liu and Tal Korem and Megan A. K. Peters},
  journal= {arXiv preprint arXiv:2405.19221},
  year   = {2024}
}

备注

main manuscript + supplement