基于监督机器学习的集体变量自动设计
机器学习
2018-05-15 v2 计算工程、金融与科学
生物大分子
摘要
为分子模拟的增强采样选取合适的集体变量仍是计算生物物理中一个未解决的问题。特别是,在高维空间中挑选初始集体变量(CVs)尤其具有挑战性。面对数千个原子坐标或其变换的列表,应挑选哪些用于增强采样运行?建模者甚至该如何着手挑选用于研究的起始坐标?即便对于简单的双态系统也是如此,而对于多态系统则难度只增不减。本工作中,我们采用受监督机器学习领域启发的数据驱动方法解决初始 CV 问题。具体而言,我们展示了监督机器学习(SML)算法中的决策函数如何用作加速采样的初始 CV(SML_cv)。以溶剂化丙氨酸二肽和 Chignolin 微型蛋白为测试用例,我们阐明了支持向量机的决策超平面距离、逻辑回归的输出概率估计、深度神经网络分类器的输出以及其他分类器如何可用于可逆地采样缓慢结构转变。我们讨论了其他可能有助于识别分子模拟加速用 CV 的 SML 算法的效用。
引用
@article{arxiv.1802.10510,
title = {Automated design of collective variables using supervised machine learning},
author = {Mohammad M. Sultan and Vijay S. Pande},
journal= {arXiv preprint arXiv:1802.10510},
year = {2018}
}
备注
26 pages, 11 figures