BioAlchemy: 将生物学文献提炼为推理就绪型强化学习训练数据的管道
计算机视觉与模式识别
2026-04-07 v1
摘要
尽管生物学训练文本库庞大,但推理模型在生物学研究中的影响仍滞后于数学和编程领域。本文表明,来自当前大规模推理数据集的生物学问题与现代生物学研究主题分布不匹配,主题不平衡可能对性能产生负面影响。此外,我们发现从生物学研究文本中提取具有挑战性且可验证的研究问题的 метод是应用于强化学习以提高生物学研究任务性能的关键且尚未得到充分发展的要素。我们引入BioAlchemy,一个从生物学研究文本科学语料库中源头获取可验证的问答对的管道。我们精选了BioAlchemy-345K,包含超过345K个生物学科学推理问题的训练数据集。随后,我们展示了如何将数据集对齐到现代生物学科学主题分布,以用于强化学习以提高推理性能。最后,我们 presented BioAlchemist-8B模型,该模型在生物学基准测试中相较于其基础推理模型提升了9.12%。这些结果表明了我们方法对于开发更强大生物学科学推理能力的有效性。BioAlchemist-8B模型已提供访问: https://huggingface.co/BioAlchemy。
引用
@article{arxiv.2604.03505,
title = {Multimodal Urban Tree Detection from Satellite and Street-Level Imagery via Annotation-Efficient Deep Learning Strategies},
author = {In Seon Kim and Ali Moghimi},
journal= {arXiv preprint arXiv:2604.03505},
year = {2026}
}