对话动作标记:用于目标导向对话的多回合计划器
计算与语言
2024-06-19 v1 人工智能
机器学习
摘要
我们提出了一种称为对话动作标记(DAT)的方法,用于适配目标导向对话中的语言模型代理。核心思想是将每个言语视为一个动作,从而将对话转化为可以应用强化学习等现有方法的游戏。具体而言,我们冻结一个预训练的语言模型,并训练一个小型计划模型来预测连续的动作向量,用于在每个轮次中进行受控生成。该设计避免了在奖励优化下语言退化的问题。在针对社交模拟平台 Sotopia 进行评估时,DAT 引导的 LLaMA 模型超过了 GPT-4 的性能。我们还将 DAT 应用于引导攻击者语言模型,以应对一种新型的多回合红队测试场景,揭示了潜在的新的攻击面。
引用
@article{arxiv.2406.11978,
title = {Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner},
author = {Kenneth Li and Yiming Wang and Fernanda Viégas and Martin Wattenberg},
journal= {arXiv preprint arXiv:2406.11978},
year = {2024}
}
备注
Code: https://github.com/likenneth/dialogue_action_token