通过自优化思维向量实现可控数学推理
人工智能
2025-10-28 v1
摘要
我们提出一种新型可控数学推理方法,利用自优化思维向量配合熵最小化。该方法引入可学习的思维向量,动态调节大型语言模型内部推理过程。以Gemma-2-9B模型在GSM8K数据集上测试,达到90.1%的准确率,控制度分为0.42,证明基于熵的奖励机制有效引导聚焦推理模式,无需外部奖励标注。我们的分析揭示了思维向量的不同聚类模式以及在各控制条件下保持一致的低熵分布,验证了该框架可实现可控AI推理。
关键词
引用
@article{arxiv.2510.22132,
title = {Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors},
author = {Xuying LI},
journal= {arXiv preprint arXiv:2510.22132},
year = {2025}
}