测试时发现的认识不确定性
机器学习
2026-05-13 v1 人工智能
摘要
使用大型语言模型进行自动化科学发现依赖于识别真正新颖的解决方案。标准强化学习会惩罚高方差变异,导致策略优先考虑熟悉模式。结果即使平均奖励提高,最大奖励也会趋于平台期。要克服这一限制,需要一种信号来区分未探索的区域与固有的困难问题。这要求测量独立适配权重假设之间的不一致,而不是依赖单个网络的置信度。UG-TTT 通过在冻结基础模型上维护少量低秩适配器来解决这一挑战。每 token 的不一致性衡量为 ensemble 预测与权重假设之间的互信息,从而隔离认识不确定性,并识别Insufficient coverage 导致适配器发散而非固有问题难度的位置。这种措施被纳入探索奖励中,用于策略梯度,引导策略前往持续适配器不一致性信号表明训练覆盖率较低的位置,即真正发现可能发生的同一前沿。核范数正则化确保适配器彼此保持独立,从而在训练期间保持探索信号。 在四个科学发现基准测试中,UG-TTT 在三个任务上提高了最大奖励,显著保持了更高的解决方案多样性,消融研究确认正则化器对于维持这种行为至关重要。
引用
@article{arxiv.2605.11328,
title = {Epistemic Uncertainty for Test-Time Discovery},
author = {Kainat Riaz and Muhammad Ahmed Mohsin and Ahsan Bilal and Muhammad Umer and Ayesha Mohsin and Aqib Riaz and Ali Subhan and John M. Cioffi},
journal= {arXiv preprint arXiv:2605.11328},
year = {2026}
}