修订Transformer:指导语言模型改变其价值观
计算与语言
2023-07-26 v3 人工智能
人机交互
摘要
当前的Transformer语言模型(LM)是拥有数十亿参数的大规模模型。它们已在多种任务上展现出高性能,但也容易出现捷径学习与偏差。通过参数调整来解决此类不正确的模型行为代价极高。这对于更新动态概念(如道德价值观,其在文化或人际间存在差异)尤为棘手。在本工作中,我们质疑当前将所有信息存储于模型参数中的普遍做法,并提出修订Transformer(RiT)以促进轻松的模型更新。将大规模预训练LM(其内在但弥散地编码世界知识)与清晰结构的修订引擎特定组合,使得能够以极小的代价并在用户交互帮助下更新模型知识。我们在一个道德数据集上示例RiT并模拟用户反馈,展示了即使在小数据下也具有强劲的模型修订性能。以此方式,用户可以依据其偏好轻松设计模型,为更透明的人工智能模型铺平道路。
引用
@article{arxiv.2210.10332,
title = {Revision Transformers: Instructing Language Models to Change their Values},
author = {Felix Friedrich and Wolfgang Stammer and Patrick Schramowski and Kristian Kersting},
journal= {arXiv preprint arXiv:2210.10332},
year = {2023}
}