ATHENA:基于语言模型的基因组纠错算法自动调参
神经与进化计算
2019-01-01 v1 基因组学
摘要
大多数作用于基因组测序读段的纠错算法的性能依赖于对其配置参数的恰当选择,例如基于k-mer技术中k的取值。本工作中,我们致力于寻找这些配置参数的最优值以优化纠错。由于观察到不同数据集(即来自不同仪器与生物体的数据)对应不同的最优配置参数,我们以数据驱动方式执行此任务。我们在算法套件Athena中运用来自自然语言处理(NLP)领域的语言建模技术,自动调优性能敏感的配置参数。通过使用N-Gram与循环神经网络(RNN)语言建模,我们验证了如下直觉:纠错性能可利用NLP中通用的困惑度(perplexity)指标进行定量且高效的计算。训练语言模型后,我们表明针对运行时数据计算的困惑度与NGS错误读段的纠错效果呈强负相关。因此,我们利用困惑度指标引导基于爬山法的搜索,收敛至最佳 值。我们的方法适用于从头测序与比较测序(重测序),无需参考基因组作为真值。这一点很重要,因为参考基因组的使用常会沿流程各阶段传递偏差。
引用
@article{arxiv.1812.11467,
title = {ATHENA: Automated Tuning of Genomic Error Correction Algorithms using Language Models},
author = {Mustafa Abdallah and Ashraf Mahgoub and Saurabh Bagchi and Somali Chaterji},
journal= {arXiv preprint arXiv:1812.11467},
year = {2019}
}
备注
10 main pages, 7 references and appendices