中文

风格向量对大语言模型引擎效果的评估:基于人类评估

人工智能 2026-01-30 v1 计算与语言 人机交互

摘要

在推理阶段控制大语言模型 (LLM) 的行为是至关重要的,以确保其输出符合人类的能力和安全要求。\emph{激活引导}提供了一种轻量级的替代方案,相对于提示工程和微调,通过直接修改内部激活来引导生成。本研究在三个方面推进了该领域的文献:首先,尽管先前的工作已证明了使用自动分类器对情感语调进行引导的技术可行性,但本文首次对激活引导在情感语调方面的效果进行人类评估,收集了来自190名参与者的7000多条众所周知的评级(通过Prolific,n=190n=190)。这些评级评估 perceived 情感强度和整体文本质量。其次,我们发现人类和基于模型的质量评级之间存在强烈的一致性(平均 r=0.776r=0.776,范围 0.1570.157--0.9850.985),表明自动评分可以代理 perceived 质量。在适度的引导强度下(λ0.15\lambda \approx 0.15),target 情感可靠放大,同时保持可理解性,最强效果出现在厌恶(ηp2=0.616\eta_p^2 = 0.616)和恐惧(ηp2=0.540\eta_p^2 = 0.540),而惊讶的效果则最小(ηp2=0.042\eta_p^2 = 0.042)。最后,升级从Alpaca到LlaMA-3后,激活引导更加一致,情感和强度均产生显著效果(所有 p<0.001p < 0.001)。评估者之间的可靠性很高(ICC =0.71= 0.71--0.870.87),强调了发现的稳健性。这些发现支持基于激活的控制作为一种可扩展的方法,用于在情感维度上引导LLM行为。

关键词

引用

@article{arxiv.2601.21505,
  title  = {The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation},
  author = {Diaoulé Diallo and Katharina Dworatzyk and Sophie Jentzsch and Peer Schütt and Sabine Theis and Tobias Hecking},
  journal= {arXiv preprint arXiv:2601.21505},
  year   = {2026}
}