Alignment Studio:面向特定上下文法规的大型语言模型对齐
计算与语言
2024-03-18 v1 人工智能
机器学习
摘要
大型语言模型的对齐通常由模型提供商执行,以添加或控制跨用例和上下文普遍被理解或通用的行为。在本文中,我们提出一种方法和架构,使应用程序开发人员能够针对其特定价值观、社会规范、法律及其他法规进行调谐,并在上下文中协调潜在的冲突要求。我们阐述了此Alignment Studio架构的三个主要组件:Framers、Instructors和Auditors,这些组件协同工作以控制语言模型的行为。我们通过将企业内部-facing聊天机器人对齐到其业务行为准则的运行示例来说明这一方法。
引用
@article{arxiv.2403.09704,
title = {Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations},
author = {Swapnaja Achintalwar and Ioana Baldini and Djallel Bouneffouf and Joan Byamugisha and Maria Chang and Pierre Dognin and Eitan Farchi and Ndivhuwo Makondo and Aleksandra Mojsilovic and Manish Nagireddy and Karthikeyan Natesan Ramamurthy and Inkit Padhi and Orna Raz and Jesus Rios and Prasanna Sattigeri and Moninder Singh and Siphiwe Thwala and Rosario A. Uceda-Sosa and Kush R. Varshney},
journal= {arXiv preprint arXiv:2403.09704},
year = {2024}
}
备注
7 pages, 5 figures