中文

通过利用LLM自我扮演与自我改进来规范模型行为

人机交互 2025-03-07 v1

摘要

训练AI模型具有挑战性,尤其是在制定行为指令时。传统方法依赖于机器(监督学习)或手动模式发现,这导致模型不可解释或耗时。虽然大型语言模型(LLMs)通过自然语言简化了指令编写,但阐述预期的模型行为仍然困难。我们引入了Visionary Tuning——一种人机回路的自我扮演后自动自我改进的方法,用于改进行为规范。我们的系统通过自我扮演帮助用户澄清期望行为,并通过自我改进生成提示。我们的第一次评估涉及在聊天机器人行为背景下对Visionary Tuning系统实现进行的用户研究。我们的系统通过模拟用户交互进行自我扮演,以识别模式并基于该模式创建有效提示。在一项被试内研究(N=12)中,参与者通过自我扮演识别了更多模式并制定了更好的提示。令人惊讶的是,用户在规范模型行为方面的成功感或高或低。后续众包研究(N=60)证实,聊天机器人在未牺牲质量的情况下遵循了指令。我们的第二次评估是一项使用Visionary Tuning和电影评分数据集的真实世界实现案例研究,展示了其在模拟从低分到高分电影范围内评论家偏好方面的有效性和鲁棒性。综合来看,这些结果表明AI如何改进交互式AI系统的设计过程。此外,它们表明这些工具的益处对终端用户来说可能并不显而易见。我们反思了这些发现并提出了未来方向。

关键词

引用

@article{arxiv.2503.03967,
  title  = {Model Behavior Specification by Leveraging LLM Self-Playing and Self-Improving},
  author = {Soya Park and J. D. Zamfirescu-Pereira and Chinmay Kulkarni},
  journal= {arXiv preprint arXiv:2503.03967},
  year   = {2025}
}