中文

CLAVE:用于评估 LLM 生成响应价值的自适应框架

计算与语言 2024-07-16 v1 人工智能

摘要

大语言模型(LLM)的快速发展带来了潜在风险,如生成不道德内容。评估 LLM 的价值观有助于暴露其背离人类价值观的倾向,但依赖于无参考评估者,即微调后的 LLM 或类似 GPT-4 之类的封闭式模型,以识别生成响应中反映的价值观。然而,这些评估者在开放式价值评估中面临两个挑战:它们应在最低标注量下与不断变化的人类价值定义保持一致,同时要抑制自身偏见(可适应性),并且能稳健地检测不同表达和情境下的价值观(可泛化性)。为处理这些挑战,我们引入 CLAVE,一种新型框架,集成两种互补 LLM:大型模型从少量人类标签中提取高层次价值概念,利用其广泛知识和泛化能力;小型模型则在此类概念上进行微调,以更好地与人类价值理解保持一致。这种双模型方法 enables 使用每个价值类型 <100 份人类标注样本进行校准。随后我们提出 ValEval,一个包含 13000 多条(text,value,label) 元组的全方位数据集,覆盖多个领域,涵盖三个主要价值体系。我们对 12 多个流行 LLM 评估器进行基准测试并分析其优势与不足。我们的发现表明,组合微调小型模型和基于提示的大型模型在价值评估中表现更佳。

关键词

引用

@article{arxiv.2407.10725,
  title  = {CLAVE: An Adaptive Framework for Evaluating Values of LLM Generated Responses},
  author = {Jing Yao and Xiaoyuan Yi and Xing Xie},
  journal= {arXiv preprint arXiv:2407.10725},
  year   = {2024}
}