中文

空能指问题:迈向更清晰的大语言模型“对齐”操作化范式

计算与语言 2023-11-16 v2 计算机与社会

摘要

在本文中,我们通过后结构主义社会政治理论的视角,具体审视其与空能指(empty signifiers)的相似性,来探讨大语言模型(LLMs)中的“对齐”概念。为围绕抽象对齐概念如何在经验数据集中被操作化建立共享词汇,我们提出一个框架,其划定:1)哪些模型行为维度被视为重要,然后 2)这些维度上的意义与定义如何被赋予,以及由谁赋予。我们定位现有经验文献,并就选择何种范式提供指导。通过该框架,我们旨在培育透明与批判评估的文化,协助社区应对将 LLMs 与人群对齐的复杂性。

关键词

引用

@article{arxiv.2310.02457,
  title  = {The Empty Signifier Problem: Towards Clearer Paradigms for Operationalising "Alignment" in Large Language Models},
  author = {Hannah Rose Kirk and Bertie Vidgen and Paul Röttger and Scott A. Hale},
  journal= {arXiv preprint arXiv:2310.02457},
  year   = {2023}
}

备注

Socially Responsible Language Modelling Research (SoLaR) @ NeurIPs 2023