中文

SudoLM:基于授权对齐的参数化知识访问控制学习

计算与语言 2025-06-10 v3 人工智能

摘要

现有的偏好对齐机制是一种通用型对齐方式,large language model(LLM)的参数化知识中带有非偏好特征的部分会被统一屏蔽给所有用户。然而,这部分知识对经验丰富的用户(其专业资格使其能够处理此类信息)是有用的。通用的单一对齐机制削弱了LLM对这些合格用户的实用性。为此,我们提出了SudoLM框架,让LLMs通过授权对齐学习针对不同用户凭证的参数化知识访问控制。SudoLM允许获得授权的用户通过分配的SUDO密钥解锁对所有参数化知识的访问,而对非合格用户则屏蔽访问。实验在两个应用场景下表明,SudoLM有效控制了用户对参数化知识的访问,同时保持了其通用实用性。

关键词

引用

@article{arxiv.2410.14676,
  title  = {SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment},
  author = {Qin Liu and Fei Wang and Chaowei Xiao and Muhao Chen},
  journal= {arXiv preprint arXiv:2410.14676},
  year   = {2025}
}

备注

ACL 2025