中文

面向可靠评估的行为驾驶干预方法探索

人工智能 2024-10-23 v1 计算与语言

摘要

表示工程方法最近在启用模型行为驾驶方面展现了前景。然而,这些方法的评估管道主要依赖主观演示,而非定性、客观指标。我们致力于通过提倡四个缺失的属性来缓解此问题:(i)应使用足够类似下游任务的上下文来评估干预质量;(ii)应考虑模型概率;(iii)评估应允许在不同目标行为之间进行标准化比较;(iv)应提供基线比较。我们引入的评估管道基于这些标准,提供对给定方法有效性的定量与可视化分析。我们利用此管道评估了两种表示工程方法,衡量其引导诸如诚实性和可纠正性等行为效果,发现某些干预比此前报告的更不有效。

关键词

引用

@article{arxiv.2410.17245,
  title  = {Towards Reliable Evaluation of Behavior Steering Interventions in LLMs},
  author = {Itamar Pres and Laura Ruis and Ekdeep Singh Lubana and David Krueger},
  journal= {arXiv preprint arXiv:2410.17245},
  year   = {2024}
}

备注

Accepted to the NeurIPS 2024 - Workshop on Foundation Model Interventions