面向可靠评估的行为驾驶干预方法探索
人工智能
2024-10-23 v1 计算与语言
摘要
表示工程方法最近在启用模型行为驾驶方面展现了前景。然而,这些方法的评估管道主要依赖主观演示,而非定性、客观指标。我们致力于通过提倡四个缺失的属性来缓解此问题:(i)应使用足够类似下游任务的上下文来评估干预质量;(ii)应考虑模型概率;(iii)评估应允许在不同目标行为之间进行标准化比较;(iv)应提供基线比较。我们引入的评估管道基于这些标准,提供对给定方法有效性的定量与可视化分析。我们利用此管道评估了两种表示工程方法,衡量其引导诸如诚实性和可纠正性等行为效果,发现某些干预比此前报告的更不有效。
引用
@article{arxiv.2410.17245,
title = {Towards Reliable Evaluation of Behavior Steering Interventions in LLMs},
author = {Itamar Pres and Laura Ruis and Ekdeep Singh Lubana and David Krueger},
journal= {arXiv preprint arXiv:2410.17245},
year = {2024}
}
备注
Accepted to the NeurIPS 2024 - Workshop on Foundation Model Interventions