中文

边界内的个性化:大语言模型与个性化反馈对齐的风险分类与政策框架

计算与语言 2023-03-10 v1 计算机与社会

摘要

大语言模型(LLMs)被用于为广泛任务生成内容,并且由于集成于 ChatGPT 等产品界面或 Bing 等搜索引擎中,其受众在未来几年将持续增长。这加剧了确保模型与人类偏好对齐且不产生不安全、不准确或有毒输出的需求。尽管诸如基于人类反馈的强化学习(RLHF)和红队测试等对齐技术能缓解部分安全担忧并提升模型能力,但聚合微调过程不太可能充分代表全部用户的偏好与价值观。不同人群对其语言与对话规范的偏好,以及指导其交流的价值观或意识形态,可能合理存在分歧。通过微观层面偏好学习过程个性化 LLMs,可能产生与每位用户更好对齐的模型。然而,在界定社会可接受且安全的个性化程度边界方面,存在若干规范性挑战。在本文中,我们探问 LLMs 应如何在哪些方面被个性化。首先,我们回顾当前将 LLMs 与人类反馈对齐的范式文献,并指出包括(i)对齐含义缺乏清晰界定;(ii)技术提供者倾向于规定 inherently 主观偏好与价值观的定义;(iii)“众包工作者的暴政”,因缺乏对所真正对齐对象的记录而加剧等问题。其次,我们提出一个关联个性化 LLMs 对个体与社会的收益与风险的分类法。最后,我们提出一个三级政策框架,使用户能体验个性化对齐的益处,同时将不安全与不良 LLM 行为约束在(超)国家与组织边界内。

关键词

引用

@article{arxiv.2303.05453,
  title  = {Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback},
  author = {Hannah Rose Kirk and Bertie Vidgen and Paul Röttger and Scott A. Hale},
  journal= {arXiv preprint arXiv:2303.05453},
  year   = {2023}
}

备注

19 pages, 1 table