中文

CONSCENDI:一种面向虚拟助手护栏模型的对比与场景引导蒸馏方法

计算与语言 2024-04-05 v2 人工智能 机器学习

摘要

日益强大的大语言模型(LLMs),如 GPT-4(OpenAI, 2023),推动了新一波基于任务的虚拟助手的兴起。在真实场景中部署基于 LLM 的虚拟对话助手的一个主要挑战是确保其操作符合任务所允许的范围。为克服这一挑战,这些虚拟助手的设计者依赖于一个独立的护栏系统,用于验证虚拟助手的输出是否符合任务所需的约束。然而,依赖常用的基于提示的护栏可能难以正确且全面地设计。为应对这些挑战,我们提出了 CONSCENDI。我们使用 CONSCENDI 通过两个关键的 LLM 驱动组件详尽地生成训练数据:场景增强生成与对比训练样本。在生成对话数据时,我们生成一组违规场景,枚举了规则可能被违反的多样化高层方式。这种场景引导方法产生了多样化的训练集,并为聊天机器人设计者提供了更大的控制力。为生成对比样本,我们提示 LLM 将含违规的对话改写为可接受的对话,以实现细粒度区分。随后我们使用 CONSCENDI 生成的该数据来训练一个较小的模型。我们发现,CONSCENDI 产生的护栏模型在多个对话领域均优于基线。

关键词

引用

@article{arxiv.2304.14364,
  title  = {CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants},
  author = {Albert Yu Sun and Varun Nair and Elliot Schumacher and Anitha Kannan},
  journal= {arXiv preprint arXiv:2304.14364},
  year   = {2024}
}

备注

To appear in NAACL 2024