实时对齐:使聊天机器人行为适应既定规范
计算与语言
2023-12-27 v1
摘要
本文旨在使大型语言模型与随时间、地点不断变化、复杂多样的人类价值观(如社会规范)对齐。这对现有的对齐技术(如监督微调)提出了挑战,这些技术将价值观内化到模型参数中。为了克服这一点,我们提出了一种实时偏好优化(OPO)方法,这是一种以流式方式工作的实时对齐方法。它使用外部存储器存储用于对齐的既定规则,无需进一步训练即可约束LLM的行为,从而允许方便地更新和定制人类价值观。我们还引入了一种可扩展的评估方法,以更有效地评估所提出的方法。在法律和道德领域的人工标注和自动生成问题上的实验结果表明了所提出的OPO方法的有效性。我们的代码和数据发布在https://github.com/GAIR-NLP/OPO。
引用
@article{arxiv.2312.15907,
title = {Align on the Fly: Adapting Chatbot Behavior to Established Norms},
author = {Chunpu Xu and Steffi Chern and Ethan Chern and Ge Zhang and Zekun Wang and Ruibo Liu and Jing Li and Jie Fu and Pengfei Liu},
journal= {arXiv preprint arXiv:2312.15907},
year = {2023}
}