中文

面向生物推理的无标签合成数据集创建:通过不确定性过滤

人工智能 2025-10-08 v1 机器学习

摘要

合成链律推理 (CoT) 痕迹在训练大规模推理模型 (LRM) 时广泛用于提高泛化能力,通过提供逐层监督。然而,大多数方法需要 ground-truth标签来初始化或筛选这些痕迹——在生物学等领域,这是一项高昂的瓶颈。我们提出一种无标签替代方案:基于不确定性的过滤,该方法使用模型自身的置信水平——通过如自洽性和预测困惑度等既定不确定性度量——作为外部标签的替代品。我们对多个推理痕迹进行采样,仅保留低不确定性子集。应用于生物扰动预测,该领域的 wet-lab标签尤其昂贵,我们显示筛选后的子集具有更高的准确率,并且在不确定性过滤数据上进行的监督微调 (SFT) 可超过未筛选的合成数据,缩小与 ground-truth 训练之间的差距,并超过强大的 LRM 框架。消融实验表明,按类别过滤可纠正特定类别不确定性尺度的差异,混合不确定性度量可获得更高质量的数据集。我们的结果表明,模型内部的置信水平是高效推理数据集创建的强大信号,使 LRM 在监督成本高昂的领域得以实现。

关键词

引用

@article{arxiv.2510.05871,
  title  = {Towards Label-Free Biological Reasoning Synthetic Dataset Creation via Uncertainty Filtering},
  author = {Josefa Lia Stoisser and Lawrence Phillips and Aditya Misra and Tom A. Lamb and Philip Torr and Marc Boubnovski Martell and Julien Fauqueur and Kaspar Märtens},
  journal= {arXiv preprint arXiv:2510.05871},
  year   = {2025}
}