面向可信大语言模型的无训练方法的系统性研究
计算与语言
2026-04-20 v1
摘要
随着大语言模型受到越来越多的关注并被部署到各个领域,其潜在风险(包括生成有害或有偏见的内容、产生无依据的主张以及表现出对对抗性攻击的脆弱性)已引起广泛关注。为了实现快速且低成本的适应,无训练方法最近作为后训练对齐技术的经济高效替代方案出现。尽管这些方法取得了有希望的结果,但它们在文献中的评估不一致,涵盖的可信度维度有限,并且可能引入不良副作用,例如效用下降和脆弱性增加。为了全面评估这些无训练方法的影响,我们退一步,系统地重新评估现有无训练方法在各种可信设置下的有效性及其对效用、鲁棒性和计算开销的影响。我们还根据这些方法在推理过程中干预模型信息流的位置,将它们分为三个层级(输入层、内部层和输出层)。利用这种分类法,我们对来自不同大语言模型系列和大小的每个层级的各种代表性且有效的方法进行了全面分析。我们的分析突出了当前方法中的若干权衡和未解决的挑战。我们总结了现有文献中的关键发现和局限性,并提出了在无需额外训练的情况下平衡大语言模型的可信度、效用和鲁棒性的实用建议。
引用
@article{arxiv.2604.15789,
title = {A Systematic Study of Training-Free Methods for Trustworthy Large Language Models},
author = {Wai Man Si and Mingjie Li and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2604.15789},
year = {2026}
}