中文

自提示调优:为大语言模型(LLM)启用自主角色扮演

计算与语言 2024-07-15 v1

摘要

近期大语言模型(LLM)的进展展示了其在基于不同指令和上下文准确模拟各种角色对话风格和认知过程的角色扮演能力。研究表明,赋予 LLM 专家角色(即角色扮演提示策略)可提升其在相关领域的性能。然而,该提示需要为给定问题手动设计,需要一定专业知识和迭代修改。为此,我们提出自提示调优(self-prompt tuning),使 LLM 本身通过微调生成角色扮演提示。以 LIMA 数据集为基础语料,我们使用 GPT-4 为每个数据点标注角色扮演提示,构建 LIMA-Role 数据集。随后在 LIMA-Role 上对 LLM 如 Llama-2-7B 和 Mistral-7B 进行微调。结果表明,自提示调优后的 LLM 可为任何给定问题自动生成专家角色提示。在广泛使用的 NLP 基准和开放性问题测试中,对自提示调优 LLM 进行了充分评估。我们的实证结果表明,自提示调优 LLM 在大多数数据集上均优于标准指令微调基线。这凸显了利用微调使 LLM 实现自我提示以自动化复杂提示策略的巨大潜力。我们在 \href{https://anonymous.4open.science/r/Self-Prompt-Tuning-739E/}{url} 公开数据集、模型和代码。

关键词

引用

@article{arxiv.2407.08995,
  title  = {Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs},
  author = {Aobo Kong and Shiwan Zhao and Hao Chen and Qicheng Li and Yong Qin and Ruiqi Sun and Xin Zhou and Jiaming Zhou and Haoqin Sun},
  journal= {arXiv preprint arXiv:2407.08995},
  year   = {2024}
}