偏离轨道:引导语言模型的可靠性挑战
计算与语言
2025-04-08 v1
摘要
语言模型(LMs)的引导方法正变得流行,作为轻量级的微调替代方案,使其能够针对性地修改模型激活。然而,现有研究主要在少数几个模型上报告结果,留下了对这些方法鲁健性理解的关键空白。本文系统性地检视了三个突出的引导方法——DoLa、函数向量和任务向量。与原始研究不同,我们测试了最多36个属于14个模型家族的模型,模型规模从1.5B到70B参数不等。我们的实验揭示了引导方法有效性存在显著变异,其中大量模型显示出在引导性能方面没有改善,甚至会出现性能下降。我们的分析表明,这些方法所基于的假设存在根本性缺陷,挑战了其作为可扩展引导解决方案的可靠性。
引用
@article{arxiv.2504.04635,
title = {Steering off Course: Reliability Challenges in Steering Language Models},
author = {Patrick Queiroz Da Silva and Hari Sethuraman and Dheeraj Rajagopal and Hannaneh Hajishirzi and Sachin Kumar},
journal= {arXiv preprint arXiv:2504.04635},
year = {2025}
}