空能指问题:迈向更清晰的大语言模型“对齐”操作化范式
计算与语言
2023-11-16 v2 计算机与社会
摘要
在本文中,我们通过后结构主义社会政治理论的视角,具体审视其与空能指(empty signifiers)的相似性,来探讨大语言模型(LLMs)中的“对齐”概念。为围绕抽象对齐概念如何在经验数据集中被操作化建立共享词汇,我们提出一个框架,其划定:1)哪些模型行为维度被视为重要,然后 2)这些维度上的意义与定义如何被赋予,以及由谁赋予。我们定位现有经验文献,并就选择何种范式提供指导。通过该框架,我们旨在培育透明与批判评估的文化,协助社区应对将 LLMs 与人群对齐的复杂性。
引用
@article{arxiv.2310.02457,
title = {The Empty Signifier Problem: Towards Clearer Paradigms for Operationalising "Alignment" in Large Language Models},
author = {Hannah Rose Kirk and Bertie Vidgen and Paul Röttger and Scott A. Hale},
journal= {arXiv preprint arXiv:2310.02457},
year = {2023}
}
备注
Socially Responsible Language Modelling Research (SoLaR) @ NeurIPs 2023