中文

政策图: 引导大语言模型行为无限空间的工具

人机交互 2025-08-04 v2 人工智能 计算与语言 机器学习

摘要

AI政策为AI模型设定了可接受行为的边界,但在大型语言模型(LLM)的背景下这一问题尤为棘手:如何确保覆盖广泛的行为空间?我们引入政策图(Policy Maps)方法,灵感来自物理制图实践.不追求全覆盖,政策图帮助有效地通过对哪些方面进行捕获、哪些方面被抽象化等意图性选择来进行导航.我们提出了Policy Projector,一个用于设计LLM政策图的交互式工具,AI实践者可以调查模型输入输出对的景观,定义自定义区域(例如"暴力"),并通过if-then政策规则来导航这些区域并作用于LLM输出(例如,若输出包含"暴力"且"细节血腥",则改写为不含"细节血腥"的内容).Policy Projector支持使用LLM分类和引导进行交互式政策编写,并反映AI实践者工作的地图可视化.在针对12位AI安全专家的评估中,我们的系统帮助政策设计师围绕如性别假设错误和处理紧急物理安全威胁等有问题的模型行为制定政策.

关键词

引用

@article{arxiv.2409.18203,
  title  = {Policy Maps: Tools for Guiding the Unbounded Space of LLM Behaviors},
  author = {Michelle S. Lam and Fred Hohman and Dominik Moritz and Jeffrey P. Bigham and Kenneth Holstein and Mary Beth Kery},
  journal= {arXiv preprint arXiv:2409.18203},
  year   = {2025}
}

备注

UIST 2025