中文

通过退化度量 DNA 序列数据质量

机器学习 2022-10-12 v1 机器学习 应用统计

摘要

我们提出并应用了一种表征基因组数据质量的新范式,其量化了有意质量退化的效应。其原理在于:初始质量越高,基因组越脆弱,退化的效应越大。我们证明该现象具有普遍性,且量化的退化度量可用于多种目的。我们聚焦于识别就数据质量而言可能存在问题的离群值,但其也可能是真实的异常甚至是对数据库的蓄意破坏企图。

关键词

引用

@article{arxiv.2112.13111,
  title  = {Measuring Quality of DNA Sequence Data via Degradation},
  author = {Alan F. Karr and Jason Hauzel and Adam A. Porter and Marcel Schaefer},
  journal= {arXiv preprint arXiv:2112.13111},
  year   = {2022}
}