中文

SPRI:将大型语言模型与情境化原则对齐

计算与语言 2025-05-30 v2 人工智能

摘要

将大型语言模型对齐以整合并反映人类价值观,尤其是对于需要复杂人类监督的任务,是艰巨的,因为依赖人类专业知识获取特定情境的指导既耗费资源又耗时。先前的工作利用预定义的规则集或原则来引导模型行为。然而,这些原则往往是通用的,使得它们难以适应每个单独的输入查询或上下文。在这项工作中,我们提出了情境化原则框架,这是一个需要极少或无需人工努力的框架,旨在为每个输入查询实时自动生成指导原则,并利用它们来对齐每个响应。我们在三个任务上评估了情境化原则,并表明:1)情境化原则可以在复杂的特定领域任务中推导出原则,其性能与专家制定的原则相当;2)情境化原则生成的原则产生了特定于实例的评分标准,其性能优于先前的大语言模型即裁判框架;3)使用情境化原则生成合成监督微调数据可以显著提高真实性。我们在https://github.com/honglizhan/SPRI-public上发布了我们的代码和模型生成结果。

关键词

引用

@article{arxiv.2502.03397,
  title  = {SPRI: Aligning Large Language Models with Context-Situated Principles},
  author = {Hongli Zhan and Muneeza Azmat and Raya Horesh and Junyi Jessy Li and Mikhail Yurochkin},
  journal= {arXiv preprint arXiv:2502.03397},
  year   = {2025}
}

备注

Forty-Second International Conference on Machine Learning (ICML 2025) Camera-Ready Version