ThinkPilot:通过自动化 Think 前缀优化引导推理模型
人工智能
2025-10-15 v1 计算与语言
摘要
大型推理模型 (LRM) 虽强大,但仍存在推理效率低和目标不精准的问题。当前训练无关方法要么受限于僵化的启发式方法,要么是描述性的、不可操作的分析。本文引入 ThinkPilot,一个训练无关的框架,用于自动优化 LRM 的推理。它通过演化过程生成 think 前缀,这些前缀由推理行为分类学驱动演化,以引导模型实现更佳性能。广泛实验表明,ThinkPilot 的效果广泛:它在高效推理的准确率-长度权衡方面显著提升,大幅提高了安全性(例如将 DeepSeek-R1-Distill-Qwen-32B 的 StrongREJECT 分数从 27.0% 降至 0.7%),并增强了指令遵循能力。它还与现有训练方法形成协同作用。我们的分析揭示,think 前缀可可靠地控制 LRM 的推理行为,且不同任务对特定行为分布有强烈偏好。通过自动识别和引导这些行为,ThinkPilot 提供了一个可推广的框架,用于将 LRM 的推理与任务需求对齐。数据和代码已公开于 https://github.com/teqkilla/ThinkPilot。
引用
@article{arxiv.2510.12063,
title = {ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization},
author = {Sunzhu Li and Zhiyu Lin and Shuling Yang and Jiale Zhao and Wei Chen},
journal= {arXiv preprint arXiv:2510.12063},
year = {2025}
}