模拟退火增强了自回归语言模型的心智推理能力
计算与语言
2026-01-21 v1 人工智能
摘要
自回归语言模型是下一个词的预测器,因只优化表面合理性(即局部连贯性)而被批评,未能保持正确的潜在状态表示(即全局连贯性)。由于心智推理(ToM)任务关键依赖于推理关于自身和他人的潜在心理状态,这类模型因此常被认为在 ToM 方面失败。虽然后训练方法可改善 ToM 性能,但我们展示了强大的 ToM 能力可直接从基础模型中恢复,而无需任何额外的权重更新或验证。我们的方法建立在最近的 power-sampling 方法(Karan & Du, 2025)之上,这些方法使用蒙特卡洛链(MCMC)从自回归语言模型的序列层面(而非词层面)概率分布中进行抽样。我们进一步发现,纳入退火,即将温度较高的温度分布逐渐从高到低转换为低温度分布,显著优于固定温度的 power 抽样改进了 ToM 性能。总体而言,这些结果表明,基于抽样的优化为在不重新训练的情况下从语言模型中提取潜在能力提供了强大的手段。
引用
@article{arxiv.2601.12269,
title = {Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models},
author = {Xucong Hu and Jian-Qiao Zhu},
journal= {arXiv preprint arXiv:2601.12269},
year = {2026}
}