中文

基于二次优化退火的因子分解机器RNA逆折叠

机器学习 2026-02-19 v1 统计力学

摘要

RNA逆折叠问题旨在识别优先采取给定目标次级结构的核苷酸序列。虽然已提出多种启发式和机器学习方法,但许多方法需要大量序列评估,这会限制其在实验验证成本高昂时应用的可行性。我们提出一种方法使用因子分解机器配合二次优化退火(FMQA)来解决该问题。FMQA是一种离散黑箱优化方法,已报告可在有限评估次数下获得高质量解。将FMQA应用于该问题需要将核苷酸转换为二进制变量。然而,整数到核苷酸分配和二进制-整数编码对FMQA性能的影响尚未深入调查,尽管此类选择决定了代理模型的结构和搜索景观,从而直接影响解的质量。因此,本研究旨既建立一种新的FMQA框架用于RNA逆折叠,又分析这些分配和编码方法的效应。我们评估了将四个核苷酸分配到有序整数(0-3)的24种可能分配方式,结合四种二进制-整数编码方法。结果表明,一键编码和域壁编码在标准化ensemble缺陷值方面优于二进制和单值编码。在域壁编码中,分配给边界整数(0和3)的核苷酸出现频率更高。在RNA逆折叠问题中,将腺嘌呤和胞嘌呤分配给这些边界整数可促进它们在 stem 区域的富集,从而导致比一键编码获得的次级结构更稳定。

关键词

引用

@article{arxiv.2602.16643,
  title  = {Factorization Machine with Quadratic-Optimization Annealing for RNA Inverse Folding and Evaluation of Binary-Integer Encoding and Nucleotide Assignment},
  author = {Shuta Kikuchi and Shu Tanaka},
  journal= {arXiv preprint arXiv:2602.16643},
  year   = {2026}
}

备注

17 pages, 10 figures