是否要引导?基于放弃选择的语言模型机械化误差降低
机器学习
2025-10-16 v1 人工智能
摘要
我们引入基于放弃选择的机械化误差降低框架 (MERA),以原则性方法引导语言模型 (LM) 通过选择性、自适应干预来减轻误差。不同于依赖固定、手动调谐引导强度的现有方法,常导致过度或不足引导,MERA 通过 (i) 优化干预方向,和 (ii) 校准何时以及如何引导,从而在无法确定可信纠正时可证明地提升性能或放弃。跨 diverse 数据集和 LM 族的实验表明,MERA 实现了安全、有效、不降级的误差纠正,并且 MERA 优于现有基线。此外,MERA 可应用于现有引导技术之上,以进一步提升其性能,确立其作为通用且高效的机械化激活引导方法。
引用
@article{arxiv.2510.13290,
title = {To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models},
author = {Anna Hedström and Salim I. Amoukou and Tom Bewley and Saumitra Mishra and Manuela Veloso},
journal= {arXiv preprint arXiv:2510.13290},
year = {2025}
}
备注
ICML 2025, 22 pages, 16 figures, 5 tables