中文

利用提示方法近似社交聊天机器人的在线人工评估

计算与语言 2023-08-28 v2 人机交互

摘要

随着对话模型日益向公众开放,用户正在社交互动中使用该技术。除非对该技术进行适当控制,否则这种前所未有的交互体验可能给用户带来相当大的社会与心理风险。这凸显了对可扩展且鲁棒的对话聊天机器人评估指标的需求。现有评估指标旨在自动化离线用户评估并近似对预先策划对话的人工判断。然而,它们捕捉实际与机器人交互的用户主观感知的能力有限,且可能无法推广到真实场景。为应对此局限,我们提出一种利用GPT系列大语言模型(LLMs)近似在线人工评估的方法。我们引入一种基于提示的对话系统评估框架(DEP),其实现了完全自动的评估流程,可复现实时用户研究,并与人类判断达到令人印象深刻的相关系数(系统级最高Pearson r=0.95)。DEP方法包括在other-play设定下用LLM收集被评估机器人的合成聊天日志,其中LLM被精心设定条件以遵循特定场景。我们进一步探索不同的提示方法,用同一LLM生成评估分数。表现最佳的提示包含少样本示范与指令,在测试数据集上展现出卓越性能,并证明可推广到其他对话语料库。

关键词

引用

@article{arxiv.2304.05253,
  title  = {Approximating Online Human Evaluation of Social Chatbots with Prompting},
  author = {Ekaterina Svikhnushina and Pearl Pu},
  journal= {arXiv preprint arXiv:2304.05253},
  year   = {2023}
}

备注

accepted to SIGDIAL 2023 (long paper)