测试时基于黎巴辛激活引导的多样化推理
机器学习
2025-11-12 v1 人工智能
摘要
最佳-N推理通过对多个候选解进行采样,然后根据某些标准选择最佳解来提高语言模型在解决复杂任务方面的准确性。但该策略的一个关键瓶颈是输出多样性受限,当模型尽管进行随机采样仍生成相似的输出时,导致相同的错误被重复。在针对推理路径缺乏方差问题时,我们提出了一种新的无监督激活引导策略,用于在测试时同时优化多个推理轨迹的引导向量。在批量生成过程中任意一个同步锚点处,我们找到能够最大化所有可能介入激活子集所跨越总体积的引导向量。我们展示,这些引导向量可以通过在球的乘积上以行列式目标函数求解的黎巴辛优化问题来确定。随后,我们使用经调优学习率的黎巴辛块坐标下降算法获得问题的平稳点,并在生成过程到达下一个同步锚点之前应用这些引导向量。在流行数学基准测试上的经验评估表明,我们的测试时黎巴辛激活引导策略在生成多样性和解答准确性方面优于普通采样技术。
引用
@article{arxiv.2511.08305,
title = {Test-time Diverse Reasoning by Riemannian Activation Steering},
author = {Ly Tran Ho Khanh and Dongxuan Zhu and Man-Chung Yue and Viet Anh Nguyen},
journal= {arXiv preprint arXiv:2511.08305},
year = {2025}
}
备注
19 pages, 6 figures. Accepted for publication at AAAI 2026 (40th AAAI Conference on Artificial Intelligence)