中文

对话动作标记:用于目标导向对话的多回合计划器

计算与语言 2024-06-19 v1 人工智能 机器学习

摘要

我们提出了一种称为对话动作标记(DAT)的方法,用于适配目标导向对话中的语言模型代理。核心思想是将每个言语视为一个动作,从而将对话转化为可以应用强化学习等现有方法的游戏。具体而言,我们冻结一个预训练的语言模型,并训练一个小型计划模型来预测连续的动作向量,用于在每个轮次中进行受控生成。该设计避免了在奖励优化下语言退化的问题。在针对社交模拟平台 Sotopia 进行评估时,DAT 引导的 LLaMA 模型超过了 GPT-4 的性能。我们还将 DAT 应用于引导攻击者语言模型,以应对一种新型的多回合红队测试场景,揭示了潜在的新的攻击面。

关键词

引用

@article{arxiv.2406.11978,
  title  = {Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner},
  author = {Kenneth Li and Yiming Wang and Fernanda Viégas and Martin Wattenberg},
  journal= {arXiv preprint arXiv:2406.11978},
  year   = {2024}
}

备注

Code: https://github.com/likenneth/dialogue_action_token