在多轮对话中引出行为
计算与语言
2025-12-30 v1 机器学习
摘要
在对话场景中从大语言模型(LLMs)识别特定且通常复杂的行为,对于其评估至关重要。近期工作提出了寻找自然语言提示以从目标模型中引出特定行为的新技术,但这些技术主要在单轮场景中研究。在本工作中,我们研究多轮对话场景中的行为引出。我们首先提供了一个分析框架,根据现有方法与目标模型的交互方式将其分为三类:仅使用先验知识的方法、使用离线交互的方法以及从在线交互中学习的方法。然后,我们引入了在线方法的多轮广义表述,统一了单轮与多轮引出。我们在自动生成多轮测试用例上评估了所有三类方法。我们通过分析查询预算(即与目标模型的交互次数)与成功率(即引出行为的输入的发现率)之间的权衡,研究了这些方法的效率。我们发现,在三个任务上,在线方法仅需几千次查询即可实现 45/19/77% 的平均成功率,而现有基于多轮对话基准测试的静态方法几乎找不到甚至找不到任何失败案例。我们的工作突出了行为引出方法在多轮对话评估中的新应用,以及社区向动态基准测试发展的必要性。
引用
@article{arxiv.2512.23701,
title = {Eliciting Behaviors in Multi-Turn Conversations},
author = {Jing Huang and Shujian Zhang and Lun Wang and Andrew Hard and Rajiv Mathews and John Lambert},
journal= {arXiv preprint arXiv:2512.23701},
year = {2025}
}