中文

利用大语言模型进行自动对话分析

计算与语言 2023-09-14 v1

摘要

开发高性能对话系统受益于对系统回复中不良行为的自动识别。然而,检测此类行为仍具挑战性,因其需要广泛的常识与对会话实践的理解。尽管近期研究聚焦于构建专用分类器以检测特定对话行为,其行为覆盖仍不完整,且缺乏在真实人机交互上的测试。本文考察了最先进的大语言模型(LLM)ChatGPT-3.5 在真实人机对话中检测九类对话行为的能力。我们旨在评估 ChatGPT 是否能匹敌专用模型并接近人类表现,从而降低行为检测任务的成本。我们的发现显示,专用模型与 ChatGPT 均尚未在此任务上取得满意结果,均落后于人类表现。尽管如此,ChatGPT 展现出可观潜力并常优于专用检测模型。我们以对 ChatGPT 普遍缺陷的深入剖析作结,为未来研究增强 LLM 能力提供指引。

关键词

引用

@article{arxiv.2309.06490,
  title  = {Leveraging Large Language Models for Automated Dialogue Analysis},
  author = {Sarah E. Finch and Ellie S. Paek and Jinho D. Choi},
  journal= {arXiv preprint arXiv:2309.06490},
  year   = {2023}
}

备注

Accepted to SIGDIAL 2023